AlexNet编辑历史

当前语言zh
版本数量1
回滚能力预留
人工修改 deepseek-ai

提交《AlexNet》修改,状态:approved

查看这次修改
# AlexNet

## 1 背景

### 1.1 图像分类与 ImageNet 挑战赛

图像分类是计算机视觉的核心任务之一,要求算法根据图像内容自动分配一个语义标签。ImageNet 大规模视觉识别挑战赛(ILSVRC)始于2010年,基于一个包含超过1000个类别、1400万张标注图片的数据集。2011年的最佳方法(基于SIFT特征和线性分类器的组合)top-5错误率约为25.8%,而人类水平估计约为5.1%。AlexNet在2012年以15.3%的top-5错误率刷新纪录,标志着深度学习正式进入主流视觉领域。

### 1.2 深度学习的早期困境与 GPU 计算的兴起

在2012年之前,深度神经网络因梯度消失、训练耗时、过拟合等问题而备受冷落。支持向量机(SVM)和手工特征(如HOG、SIFT)占据主导。同时,GPU(图形处理器)的并行计算能力开始被用于通用计算(GPGPU)。Alex Krizhevsky等人利用两块NVIDIA GTX 580 GPU实现模型并行和数据并行,将训练时间从数周压缩至数天,使得大规模深度神经网络的训练成为可能。这一尝试证明了GPU加速是深度学习复兴的关键推手。

## 2 网络架构

### 2.1 总体结构概览

AlexNet包含8层可学习参数:5个卷积层(前两个后接重叠池化层和局部响应归一化层,第三个和第四个卷积层直接连接,第五个后接重叠池化层)和3个全连接层。输入图像尺寸固定为227×227×3(RGB)。网络总参数量约为60 million,计算量约为700 million浮点运算。

### 2.2 卷积层设计与参数

#### 2.2.1 第1层:大卷积核与重叠池化

第1个卷积层使用11×11的卷积核,步长为4,输出96个特征图(分到两个GPU各48个)。紧随其后的是重叠池化层(核尺寸3×3,步长2),以及局部响应归一化(LRN)。大卷积核旨在捕获图像中较大范围的纹理和形状特征,重叠池化(池化窗口移动步长小于窗口边长)相比传统非重
Ciallo~(∠・ω< )⌒★