1 定义与基本概念

1.1 预训练模型的含义

预训练模型是指先在大规模通用数据上进行训练,学习到较为基础且可迁移的表示,再将其用于具体任务的机器学习模型。其训练过程通常不直接面向单一应用,而是先获得对语言、图像、语音或多模态信息的通用理解能力,随后再通过微调提示或其他适配方式服务于下游场景。

这类模型的核心思想,是把“先学通用能力、再做任务适配”作为统一范式。与从头训练的任务专用模型相比,预训练模型往往在数据利用率和泛化能力方面更具优势,因此在自然语言处理、计算机视觉和多模态学习中都占据重要地位。

1.2 核心特征

预训练模型通常具有三个较为突出的特征:一是能够形成跨任务通用的表示;二是在新任务上具备较好的迁移能力;三是可以对已有参数进行复用,减少重复训练的成本。

1.2.1 通用表示学习

通用表示学习指模型在预训练阶段并不只记忆单一任务的答案,而是从海量样本中抽取更抽象的结构信息,例如词语之间的依赖关系、图像中的空间模式或音频中的时序特征。这种表示往往具有一定层级性,底层捕捉局部模式,高层表达更抽象的语义概念。

1.2.2 迁移能力

迁移能力是预训练模型的重要价值之一。由于模型已经在通用数据上形成了丰富表征,在面对新的数据集或新任务时,通常只需较少的标注样本或较短的训练时间,就能达到较好的效果。迁移能力的强弱,常与预训练数据规模、模型结构和训练目标密切相关。

1.2.3 参数复用

参数复用是指同一套模型参数可以被多个任务共同使用,而不必为每个任务分别从零开始构建模型。这种方式提升了训练效率,也便于形成统一的模型底座。在工程实践中,参数复用还能降低维护成本,使模型在不同应用之间保持较高的一致性

1.3 与传统专用模型的区别

传统专用模型通常围绕单一任务设计,例如只用于分类、检测或翻译,并依赖针对该任务的特征工程与训练流程。相比之下,预训练模型更强调通用性和可扩展性,先形成“基础模型”,再适配多个任务。

二者的差异不仅体现在训练方式上,也体现在数据需求与应用形态上。专用模型往往在固定场景中较为高效,而预训练模型更适合任务多样、数据分布不断变化的环境。随着模型规模扩大,这种差异在实际应用中表现得尤为明显。

2 发展历程

2.1 早期表示学习阶段

预训练思想并非一开始就以“大模型”形态出现。早期研究更多集中词向量、特征学习和浅层神经网络等方向,目标是让模型在无监督或弱监督条件下学习数据中的结构信息。这一阶段的重点,在于证明“数据本身可以帮助模型学到有用表示”。

随着词向量方法的成熟,研究者逐步意识到,预先学习得到的表示可以显著改善下游任务效果。这为后续更大规模的预训练奠定了基础。

2.2 统计学习与神经网络的融合

在这一时期,传统统计方法与神经网络开始结合。模型不再仅依赖人工设计特征,而是通过神经结构自动提取表示,同时保留一定的概率建模思想。语言建模、序列标注和图像识别等任务都出现了可迁移的表示学习方案。

这一阶段的重要意义,在于把“训练一个通用表征,再用于多个任务”的思路逐步工程化,并推动了后续深度学习方法的普及。

2.3 大规模深度预训练的兴起

随着算力提升和数据资源扩展,大规模深度预训练成为主流路线。模型参数从百万级、千万级发展到更高数量级,训练语料也从单一数据集扩展到多源大语料。预训练不再只是辅助步骤,而逐渐成为模型能力形成的核心环节。

2.3.1 语言模型的规模化

语言模型的规模化推动了预训练范式的广泛传播。通过自回归掩码式目标,模型能够学习词序列中的语法、语义和上下文依赖关系。随着模型容量增强,这类系统在文本生成、问答和理解任务中的表现显著提升。

2.3.2 多模态预训练的发展

在语言之外,图像、语音和视频等模态也逐渐纳入预训练框架。多模态预训练试图让模型同时理解不同类型的信息,并建立跨模态对齐关系。它使模型不仅能“看懂文字”,也能关联图像内容、语音信号和场景语义。

2.4 当前主流趋势

当前预训练模型的发展呈现出几个明显趋势:模型架构更加统一,训练目标更加多样,适配方式更加灵活,工程实现更加注重效率与可部署性。与此同时,研究重点也从单纯追求参数规模,逐步转向数据质量、推理能力、可控生成安全性等综合指标

3 训练方法

3.1 预训练目标

预训练目标决定模型在训练阶段重点学习什么。不同目标对应不同的信息建模方式,也会影响模型后续的适用范围。常见目标包括生成式建模、掩码重建、对比对齐以及多任务联合学习。

3.1.1 自回归建模

自回归建模以“根据前文预测后文”为基本形式,模型在生成每个输出时,只能利用已经出现的上下文。这种方式常用于语言生成模型,也适合顺序性较强的数据。其优点是生成过程自然,适配文本续写、对话和序列预测等任务。

3.1.2 掩码建模

掩码建模通过遮蔽输入中的部分内容,要求模型根据未被遮挡的信息恢复原始片段。该方法常用于编码器类模型,能够帮助模型学习上下文依赖与全局语义。由于训练时可双向利用上下文,它在理解类任务中往往表现稳定。

3.1.3 对比学习

对比学习通过拉近正样本表示、推远负样本表示,使模型学会区分相似与不相似的样本。这种目标在视觉表示学习和跨模态对齐中非常常见,也常用于提升特征空间的判别能力。它的关键在于构造合理的样本对与对比关系。

3.1.4 多任务学习

多任务学习让模型在同一训练过程中同时优化多个目标,从而共享知识并提高泛化能力。预训练阶段采用多任务策略时,模型可能同时学习语言理解、生成、分类或检索相关目标,以增强表示的全面性。

3.2 数据准备

高质量数据是预训练效果的重要基础。由于预训练通常依赖大规模样本,数据准备环节不仅涉及收集,还包括清洗、筛选、标注与质量控制

3.2.1 语料收集

语料收集通常来自公开文本、图像库、音频库、网页内容或多模态数据集合。不同来源的数据在风格、主题噪声水平上差异明显,因此需要根据任务目标进行选择。规模固然重要,但覆盖面和多样性同样关键。

3.2.2 数据清洗与去重

清洗过程主要用于去除乱码、低质量样本、重复内容和明显异常数据。去重则有助于减少模型对少数样本的过度记忆,并降低训练偏置。对于大规模语料而言,清洗和去重往往直接影响模型的稳定性与泛化水平。

3.2.3 标注与弱监督

虽然很多预训练任务可不依赖人工标注,但在部分场景中,标注数据仍然不可缺少。弱监督则通过规则、已有系统输出或自动构造标签,降低人工成本。两者结合后,模型能够在较少精标样本的情况下继续扩展能力。

3.3 优化与训练策略

预训练通常计算量巨大,因此优化策略不仅要保证收敛,还要兼顾资源使用效率与训练稳定性。

3.3.1 分布式训练

分布式训练将模型参数、数据或计算过程分散到多台设备上,以支持更大规模的训练任务。常见做法包括数据并行、模型并行和流水线并行。其主要目的,是在可接受的时间内完成高成本训练。

3.3.2 学习率调度

学习率调度用于控制训练过程中参数更新的步幅。通常在训练初期采用较小或逐步升高的学习率,以避免不稳定;在中后期再逐步衰减,帮助模型更平滑地收敛。合适的调度策略往往对最终性能影响显著。

3.3.3 正则化方法

正则化方法用于缓解过拟合并提升泛化能力。常见手段包括权重衰减、随机失活、数据增强以及早停等。在大模型训练中,正则化的作用不仅体现在防止记忆噪声,也体现在保持表示空间的稳健性。

4 模型结构

4.1 编码器架构

编码器架构主要负责把输入映射为高维表示,适合做理解、分类和检索等任务。它通常以双向上下文建模为特点,能够整合输入中前后信息。由于输出更偏向特征而非连续生成,编码器在判别式任务中较常见。

4.2 解码器架构

解码器架构主要面向生成任务,按顺序逐步产生输出。它通常采用自回归方式,根据已有内容预测下一个单位。此类结构在文本续写、对话生成和代码生成等场景中应用广泛。

4.3 编码器-解码器架构

编码器-解码器架构将输入理解与输出生成结合起来,先由编码器提取源信息,再由解码器生成目标序列。它适合机器翻译、摘要生成和跨模态转换等任务。该结构兼顾表示能力与生成能力,因此在序列到序列任务中具有通用性。

4.4 参数规模与层数设计

参数规模和层数是模型容量的重要体现。一般而言,更深或更宽的网络能够容纳更复杂的模式,但也会带来训练难度和计算压力。设计时需要在表达能力、收敛速度与部署成本之间取得平衡。

4.5 注意力机制

注意力机制使模型能够动态关注输入中不同部分的重要性,是现代预训练模型的重要组成。它有效增强了长距离依赖建模能力,并提高了并行计算效率。

4.5.1 自注意力

自注意力允许序列中的每个位置与同一序列的其他位置建立关联,从而获得全局上下文信息。它是 Transformer 架构的重要基础,能够较好处理长文本和复杂结构数据。

4.5.2 交叉注意力

交叉注意力用于连接两个不同来源的表示,例如将文本与图像特征对齐,或让解码器关注编码器输出。它在多模态模型和编码器-解码器结构中尤为重要,承担着信息融合的作用。

5 典型类型

5.1 语言预训练模型

语言预训练模型是最常见的一类,主要面向文本理解与生成。它们通过大规模语料学习语法、语义、篇章结构和知识关联,已成为自然语言处理的基础组件。

5.1.1 词向量模型

词向量模型将词语映射到连续向量空间中,使语义相近的词在空间中彼此接近。它解决了传统离散表示难以捕捉词义相似性的缺点,也为后续上下文建模奠定了基础。

5.1.2 上下文表示模型

上下文表示模型会根据词语所处环境生成不同表示,因此同一词在不同句子中可以对应不同向量。这类模型显著提升了歧义消解和语义理解能力,也推动了问答、阅读理解等任务的发展。

5.1.3 大语言模型

大语言模型通常具有更大的参数规模和更广泛的语料覆盖,能够完成更复杂的文本生成与推理类任务。它们常结合指令适配、对齐训练和后训练方法,以增强对话、创作和工具调用能力。

5.2 视觉预训练模型

视觉预训练模型主要从图像或视频中学习通用特征,广泛用于分类、检测、分割和图像检索等任务。它们通过大量视觉数据提取纹理、形状、空间关系和语义结构。

5.2.1 图像分类模型

图像分类模型通常学习将图像映射到类别标签,常作为视觉预训练的基础形态。通过大规模分类数据训练后,模型可迁移到更复杂的视觉理解任务。

5.2.2 目标检测模型

目标检测模型不仅识别图像中有哪些对象,还要定位它们的位置。预训练使其在面对复杂背景、尺度变化和遮挡情况时更具鲁棒性。

5.2.3 视觉基础模型

视觉基础模型通常以大规模数据和统一架构为基础,能够支持多种视觉任务。它们的特点是通用性较强,可通过少量适配完成不同应用。

5.3 多模态预训练模型

多模态预训练模型试图同时处理两种或多种信息形式,例如文本、图像、语音和视频。其目标不仅是分别理解各模态内容,还包括建立模态之间的对应关系。

5.3.1 文图模型

文图模型通过联合学习文本和图像表示,实现图文检索、图像描述和跨模态问答等功能。它们在视觉语义对齐方面具有代表性。

5.3.2 语音文本模型

语音文本模型将语音信号与文字序列联系起来,可用于语音识别、语音翻译和语音交互系统。其关键在于处理声学特征与语言结构之间的映射。

5.3.3 统一表征模型

统一表征模型尝试用同一套表示空间容纳不同模态信息,从而简化任务切换和跨模态推理。此类模型往往强调结构统一性与接口一致性。

6 适配与应用

6.1 微调方法

微调是将预训练模型适配到特定任务的常用方式。它通过在目标数据上继续训练,使模型保留通用能力的同时,学习任务相关知识。

6.1.1 全参数微调

全参数微调会更新模型的全部权重,通常能获得较强的任务适配效果。其代价是计算和存储开销较大,更适合有较多资源的场景。

6.1.2 参数高效微调

参数高效微调只更新部分参数或添加少量新参数,例如适配器、前缀或低秩结构。它降低了训练成本,也方便在多个任务间切换。

6.1.3 迁移学习

迁移学习强调将已学到的知识转移到新任务中。预训练模型本质上就是迁移学习的重要载体之一,能够减少对大规模标注数据的依赖。

6.2 提示工程

提示工程通过设计输入提示,引导模型完成特定任务,而不一定需要额外训练。它在大语言模型应用中尤为常见。

6.2.1 零样本提示

零样本提示是指不给模型示例,只通过自然语言指令说明任务要求。它检验模型的通用理解能力,也常用于快速试验新任务。

6.2.2 少样本提示

少样本提示在提示中加入少量示例,帮助模型把握任务格式和输出风格。相比零样本方式,它通常能获得更稳定的结果。

6.2.3 链式提示

链式提示强调逐步引导模型进行分解推理或分段输出。它常用于复杂问题处理,使模型先展开中间步骤,再给出最终结果。

6.3 下游任务应用

预训练模型的应用范围十分广泛,几乎覆盖了常见的文本和视觉智能任务。

6.3.1 文本分类

文本分类用于判断文本所属类别,例如主题识别、情感分析或意图判定。预训练模型在该任务上通常能较快达到较高精度。

6.3.2 机器翻译

机器翻译将一种语言转换为另一种语言,要求模型同时掌握语义理解与目标语言生成。预训练有助于提升低资源语言或复杂句式下的翻译表现。

6.3.3 信息检索

信息检索关注从大规模文档中找到与查询相关的内容。预训练模型可用于查询理解、文档表示和排序优化,从而提高检索准确性。

6.3.4 内容生成

内容生成包括写作、摘要、对话、代码生成等多种形式。预训练模型在此类任务中能够利用学到的语言模式生成连贯文本。

6.3.5 图像识别与理解

图像识别与理解任务涵盖分类、定位、描述和场景分析等。视觉预训练模型可在这些任务中提供高质量特征基础,并提升对复杂图像的识别能力。

7 评估与基准

7.1 评估指标

评估指标用于衡量模型在预训练或下游任务中的表现,既要关注准确性,也要关注生成质量与概率建模能力。

7.1.1 准确率

准确率用于衡量预测正确的比例,适合类别较均衡的任务。它简单直观,因此常用于分类和识别类评估。

7.1.2 F1 值

F1 值综合考虑精确率与召回率,适用于类别不均衡或更重视检出效果的任务。它能比单一准确率更全面反映模型性能。

7.1.3 困惑度

困惑度常用于语言建模,表示模型对数据分布的不确定程度。数值越低,通常意味着模型对序列的预测越稳定。

7.1.4 生成质量指标

生成质量指标用于评价文本或图像生成结果的流畅度、一致性和与参考答案的接近程度。不同任务会采用不同指标组合,以避免单一指标失真。

7.2 基准测试

基准测试为模型提供统一对比环境,是衡量预训练模型进步的重要工具。

7.2.1 通用语言基准

通用语言基准通常覆盖阅读理解、常识问答、推理和文本分类等任务,用于检验语言模型的整体能力。

7.2.2 视觉基准

视觉基准主要评价模型在图像分类、目标识别、分割和视觉推理方面的表现,反映其对图像结构的理解程度。

7.2.3 多模态基准

多模态基准侧重考察模型在图文对齐、跨模态检索和多模态问答中的能力,能够体现其融合不同信息源的水平。

7.3 鲁棒性与泛化测试

鲁棒性与泛化测试关注模型面对噪声、分布变化、对抗扰动或不同领域数据时的稳定表现。一个模型即使在标准测试集上得分较高,也可能在真实环境中因输入变化而性能下降,因此这类测试越来越受到重视。

8 优势与局限

8.1 主要优势

预训练模型的优势主要体现在知识迁移、数据效率和任务覆盖范围三个方面。

8.1.1 知识迁移

模型能够把在通用语料中学到的结构知识迁移到具体任务上,从而减少重复学习的成本。对于样本较少的应用,这一特性尤其重要。

8.1.2 数据效率提升

由于模型先行学习了通用表示,下游任务往往只需较少标注数据即可达到可用效果。这使得预训练模型在数据稀缺场景中具有明显优势。

8.1.3 适用范围广

同一基础模型可以通过不同适配方式服务多个任务,因而具备较强的通用性。无论是理解、生成还是跨模态任务,预训练模型都能提供统一的技术底座。

8.2 主要局限

尽管优势明显,预训练模型也存在若干现实限制。

8.2.1 计算资源消耗

大规模预训练通常需要大量算力、存储和能源投入,训练成本较高,更新与迭代也不够轻便。

8.2.2 偏差与幻觉问题

模型可能继承训练数据中的偏差,或在生成时产生看似合理但实际错误的内容。此类问题会影响系统可信度,需要通过数据治理和后训练加以缓解。

8.2.3 可解释性不足

预训练模型内部参数众多,决策过程较难直观追踪,导致其输出有时难以解释。这给调试、审计和风险控制带来挑战。

8.2.4 领域适配困难

在某些专业领域,通用预训练模型未必能直接达到高水平效果。若目标领域术语密集、结构特殊或数据分布差异较大,往往仍需额外适配。

9 相关技术

9.1 迁移学习

迁移学习是一种将已有知识应用到新任务的方法。预训练模型与迁移学习关系密切,可以看作其在深度学习时代的重要实现形式。

9.2 自监督学习

自监督学习通过数据自身构造训练信号,无需大量人工标签。许多预训练方法都建立在自监督学习基础上,因此二者常被并列讨论。

9.3 半监督学习

半监督学习结合少量标注数据与大量未标注数据进行训练。它常用于标注成本较高的场景,与预训练模型的适配方式具有互补关系。

9.4 表示学习

表示学习的目标是让模型自动提取有用特征,而不是依赖人工设计。预训练模型的核心价值,很大程度上就体现在更高质量的表示学习能力上。

9.5 强化学习与后训练

强化学习与后训练常用于进一步调整模型行为,使其更符合任务目标或交互需求。它们通常发生在预训练之后,帮助模型在安全性、可控性和偏好对齐方面继续优化。

10 工程实现

10.1 训练框架

工程上,预训练模型通常依托成熟的深度学习框架实现训练、分布式通信与参数管理。训练框架不仅要支持大规模并行,还要便于日志记录、断点恢复和实验复现。

10.2 模型压缩

模型压缩用于降低模型体积和推理成本,使其更适合部署和实时应用。

10.2.1 剪枝

剪枝通过移除冗余参数或连接,减少模型复杂度。合理剪枝后,模型体积可下降,同时尽量保持性能不明显损失。

10.2.2 量化

量化将高精度参数或激活转换为低比特表示,以节省存储并提升推理效率。它在边缘设备和高并发服务中非常常见。

10.2.3 蒸馏

蒸馏通过让小模型学习大模型的输出分布或中间表示,压缩知识并保留部分能力。它适合在资源受限环境中部署较强模型。

10.3 部署与推理

部署阶段关注的是模型如何高效、稳定地提供服务。推理系统通常需要兼顾延迟、吞吐量与资源占用。

10.3.1 在线服务

在线服务强调实时响应,常用于问答、对话和搜索排序等交互式应用。它对延迟和稳定性要求较高。

10.3.2 边缘部署

边缘部署将模型放在终端或近端设备运行,便于降低通信成本并提升隐私性。其挑战主要在于设备算力有限。

10.3.3 批量推理

批量推理适合离线处理大规模数据,如文档分类、内容审核和数据分析。它更关注总体吞吐效率,而非单次响应速度。

11 未来发展

11.1 更大规模与更高效率

未来预训练模型可能继续在规模上扩展,但单纯增大参数已不再是唯一方向。更高效率的训练算法、更加优质的数据以及更低成本的推理方式,将与规模提升并行发展。

11.2 更强多模态能力

多模态模型将进一步加强对图像、语音、视频和文本的联合理解能力。随着跨模态对齐技术成熟,模型有望在更复杂的感知与推理任务中发挥作用。

11.3 个性化与可控生成

个性化与可控生成是预训练模型应用的重要方向。未来模型可能更容易根据用户偏好、任务约束或场景需求调整输出风格与内容边界。

11.4 安全性与可信性提升

随着应用范围扩大,模型的安全性、稳定性和可信性将成为关键议题。包括减少错误输出、控制偏差、增强可解释性以及提升可审计性在内的改进,将持续影响预训练模型的发展路径。