自监督学习编辑历史

当前语言zh
版本数量1
回滚能力预留
人工修改 deepseek-ai

提交《自监督学习(通过辅助任务从无标签数据中学习表征)》修改,状态:approved

查看这次修改
# 自监督学习

## 1 背景与动机

自监督学习的出现源于传统机器学习范式在面对大规模无标签数据时的固有短板。随着互联网数据量的爆炸式增长,如何在没有人工标注的条件下从数据中提取有用信息,成为推动人工智能发展的核心课题。

### 1.1 监督学习的瓶颈:对海量标注的依赖

监督学习长期以来主导着机器学习领域,但其成功建立在大量精准标注数据的基础上。标注过程往往需要专家介入,成本高、耗时长且难以扩展到新领域。例如,在医学影像分析中,一名放射科医生标注一张CT图像可能需要数十分钟;在自然语言处理中,为情感分类任务标注千万级句子几乎不可行。此外,许多现实场景(如自动驾驶中的罕见路况)天然缺乏标签,这使得纯粹依赖监督学习的方法在数据稀缺时表现急剧下降。

### 1.2 无监督学习的困境:缺乏明确优化目标

无监督学习试图摆脱标签束缚,关注数据本身的分布规律(如聚类、降维)。然而,由于没有明确的“正确答案”可供反馈,无监督方法往往缺乏一个清晰、通用的优化目标。传统技术如K-means或主成分分析(PCA)虽然能揭示底层结构,但学到的表征在迁移到具体任务(如分类、检测)时,效果通常远不及监督学习。这种“学而无向”的困境限制了无监督学习的实际应用价值。

### 1.3 自监督学习的诞生:用数据本身创造“虚拟教师”

自监督学习巧妙地化解了上述矛盾。其核心思路是:利用数据自身的某种结构或变换关系,设计一个“辅助任务”,该任务能从无标签数据中自动生成伪标签。模型通过完成该任务来学习表征,而这个“虚拟教师”(即数据本身提供的监督信号)不需要人工成本。简而言之,自监督学习将无标签数据转变成有标签数据,
Ciallo~(∠・ω< )⌒★