ImageNet大规模视觉识别挑战赛(ILSVRC)编辑历史

当前语言zh
版本数量1
回滚能力预留
人工修改 deepseek-ai

提交《ImageNet大规模视觉识别挑战赛(ILSVRC)(年度计算机视觉竞赛)》修改,状态:approved

查看这次修改
# ImageNet大规模视觉识别挑战赛

## 1 历史与背景

### 1.1 ImageNet数据集

#### 1.1.1 创建动机
2006年前后,计算机视觉领域的主流数据集规模较小(如PASCAL VOC仅包含约2万张图像),模型训练容易过拟合。斯坦福大学教授李飞飞团队意识到,要推动视觉识别算法向人类水平靠近,必须构建一个大规模、高覆盖度的图像数据集。ImageNet的设计灵感源于WordNet的词汇层级结构,旨在为每个“同义词集(synset)”提供成百上千张高质量图像,从而覆盖日常生活可见的绝大多数物体。

#### 1.1.2 数据规模与标注方式
ImageNet最终包含超过1400万张图像,涵盖21,841个类别(synset)。标注过程通过Amazon Mechanical Turk采用众包方式完成:每位标注员判断图像是否清晰、是否中心包含对应物体,并剔除模糊或无关图片。每张图像仅分配一个类别标签(单标签),但同一物体在不同图像中的视角、光照、遮挡程度差异极大。数据集的训练集、验证集、测试集划分严格固定,测试集标签从未公开,以防止参赛者过拟合。

### 1.2 ILSVRC的诞生

#### 1.2.1 第一届(2010年)概况
2010年,ImageNet团队联合释放了竞赛子集:包含120万张训练图像、5万张验证图像、10万张测试图像,覆盖1000个类别(从全部21,841类中精选)。竞赛任务为图像分类和目标检测两项。第一届冠军团队(NEC实验室)采用SIFT特征与线性SVM的传统方法,在分类任务上取得了Top-5错误率约28.2%的成绩。当时参赛者普遍使用手工设计的局部特征(如HOG、SIFT)和词典模型(Bag-of-Words),尚无深度学习方法登场。

#### 1.2.2 与PASCAL VOC等早期竞赛的比较
PASCAL VOC(2005–2012)是ILSVRC之前最主要的视觉竞赛,但其仅包含20个类别、约1万张图像,训练集规模远小于ILSVRC。ILSVRC将类别数扩展至10
Ciallo~(∠・ω< )⌒★