1 定义与基本概念
1.1 预训练模型的含义
预训练模型是指先在大规模通用数据上进行训练,学习到较为基础且可迁移的表示,再将其用于具体任务的机器学习模型。其训练过程通常不直接面向单一应用,而是先获得对语言、图像、语音或多模态信息的通用理解能力,随后再通过微调、提示或其他适配方式服务于下游场景。
这类模型的核心思想,是把“先学通用能力、再做任务适配”作为统一范式。与从头训练的任务专用模型相比,预训练模型往往在数据利用率和泛化能力方面更具优势,因此在自然语言处理、计算机视觉和多模态学习中都占据重要地位。
1.2 核心特征
预训练模型通常具有三个较为突出的特征:一是能够形成跨任务通用的表示;二是在新任务上具备较好的迁移能力;三是可以对已有参数进行复用,减少重复训练的成本。
1.2.1 通用表示学习
通用表示学习指模型在预训练阶段并不只记忆单一任务的答案,而是从海量样本中抽取更抽象的结构信息,例如词语之间的依赖关系、图像中的空间模式或音频中的时序特征。这种表示往往具有一定层级性,底层捕捉局部模式,高层表达更抽象的语义概念。
1.2.2 迁移能力
迁移能力是预训练模型的重要价值之一。由于模型已经在通用数据上形成了丰富表征,在面对新的数据集或新任务时,通常只需较少的标注样本或较短的训练时间,就能达到较好的效果。迁移能力的强弱,常与预训练数据规模、模型结构和训练目标密切相关。
1.2.3 参数复用
参数复用是指同一套模型参数可以被多个任务共同使用,而不必为每个任务分别从零开始构建模型。这种方式提升了训练效率,也便于形成统一的模型底座。在工程实践中,参数复用还能降低维护成本,使模型在不同应用之间保持较高的一致性。
1.3 与传统专用模型的区别
传统专用模型通常围绕单一任务设计,例如只用于分类、检测或翻译,并依赖针对该任务的特征工程与训练流程。相比之下,预训练模型更强调通用性和可扩展性,先形成“基础模型”,再适配多个任务。
二者的差异不仅体现在训练方式上,也体现在数据需求与应用形态上。专用模型往往在固定场景中较为高效,而预训练模型更适合任务多样、数据分布不断变化的环境。随着模型规模扩大,这种差异在实际应用中表现得尤为明显。
2 发展历程
2.1 早期表示学习阶段
预训练思想并非一开始就以“大模型”形态出现。早期研究更多集中在词向量、特征学习和浅层神经网络等方向,目标是让模型在无监督或弱监督条件下学习数据中的结构信息。这一阶段的重点,在于证明“数据本身可以帮助模型学到有用表示”。
随着词向量方法的成熟,研究者逐步意识到,预先学习得到的表示可以显著改善下游任务效果。这为后续更大规模的预训练奠定了基础。
2.2 统计学习与神经网络的融合
在这一时期,传统统计方法与神经网络开始结合。模型不再仅依赖人工设计特征,而是通过神经结构自动提取表示,同时保留一定的概率建模思想。语言建模、序列标注和图像识别等任务都出现了可迁移的表示学习方案。
这一阶段的重要意义,在于把“训练一个通用表征,再用于多个任务”的思路逐步工程化,并推动了后续深度学习方法的普及。
2.3 大规模深度预训练的兴起
随着算力提升和数据资源扩展,大规模深度预训练成为主流路线。模型参数从百万级、千万级发展到更高数量级,训练语料也从单一数据集扩展到多源大语料。预训练不再只是辅助步骤,而逐渐成为模型能力形成的核心环节。
2.3.1 语言模型的规模化
语言模型的规模化推动了预训练范式的广泛传播。通过自回归或掩码式目标,模型能够学习词序列中的语法、语义和上下文依赖关系。随着模型容量增强,这类系统在文本生成、问答和理解任务中的表现显著提升。
2.3.2 多模态预训练的发展
在语言之外,图像、语音和视频等模态也逐渐纳入预训练框架。多模态预训练试图让模型同时理解不同类型的信息,并建立跨模态对齐关系。它使模型不仅能“看懂文字”,也能关联图像内容、语音信号和场景语义。
2.4 当前主流趋势
当前预训练模型的发展呈现出几个明显趋势:模型架构更加统一,训练目标更加多样,适配方式更加灵活,工程实现更加注重效率与可部署性。与此同时,研究重点也从单纯追求参数规模,逐步转向数据质量、推理能力、可控生成和安全性等综合指标。
3 训练方法
3.1 预训练目标
预训练目标决定模型在训练阶段重点学习什么。不同目标对应不同的信息建模方式,也会影响模型后续的适用范围。常见目标包括生成式建模、掩码重建、对比对齐以及多任务联合学习。
3.1.1 自回归建模
自回归建模以“根据前文预测后文”为基本形式,模型在生成每个输出时,只能利用已经出现的上下文。这种方式常用于语言生成模型,也适合顺序性较强的数据。其优点是生成过程自然,适配文本续写、对话和序列预测等任务。
3.1.2 掩码建模
掩码建模通过遮蔽输入中的部分内容,要求模型根据未被遮挡的信息恢复原始片段。该方法常用于编码器类模型,能够帮助模型学习上下文依赖与全局语义。由于训练时可双向利用上下文,它在理解类任务中往往表现稳定。
3.1.3 对比学习
对比学习通过拉近正样本表示、推远负样本表示,使模型学会区分相似与不相似的样本。这种目标在视觉表示学习和跨模态对齐中非常常见,也常用于提升特征空间的判别能力。它的关键在于构造合理的样本对与对比关系。
3.1.4 多任务学习
多任务学习让模型在同一训练过程中同时优化多个目标,从而共享知识并提高泛化能力。预训练阶段采用多任务策略时,模型可能同时学习语言理解、生成、分类或检索相关目标,以增强表示的全面性。
3.2 数据准备
高质量数据是预训练效果的重要基础。由于预训练通常依赖大规模样本,数据准备环节不仅涉及收集,还包括清洗、筛选、标注与质量控制。
3.2.1 语料收集
语料收集通常来自公开文本、图像库、音频库、网页内容或多模态数据集合。不同来源的数据在风格、主题和噪声水平上差异明显,因此需要根据任务目标进行选择。规模固然重要,但覆盖面和多样性同样关键。
3.2.2 数据清洗与去重
清洗过程主要用于去除乱码、低质量样本、重复内容和明显异常数据。去重则有助于减少模型对少数样本的过度记忆,并降低训练偏置。对于大规模语料而言,清洗和去重往往直接影响模型的稳定性与泛化水平。
3.2.3 标注与弱监督
虽然很多预训练任务可不依赖人工标注,但在部分场景中,标注数据仍然不可缺少。弱监督则通过规则、已有系统输出或自动构造标签,降低人工成本。两者结合后,模型能够在较少精标样本的情况下继续扩展能力。
3.3 优化与训练策略
预训练通常计算量巨大,因此优化策略不仅要保证收敛,还要兼顾资源使用效率与训练稳定性。
3.3.1 分布式训练
分布式训练将模型参数、数据或计算过程分散到多台设备上,以支持更大规模的训练任务。常见做法包括数据并行、模型并行和流水线并行。其主要目的,是在可接受的时间内完成高成本训练。
3.3.2 学习率调度
学习率调度用于控制训练过程中参数更新的步幅。通常在训练初期采用较小或逐步升高的学习率,以避免不稳定;在中后期再逐步衰减,帮助模型更平滑地收敛。合适的调度策略往往对最终性能影响显著。
3.3.3 正则化方法
正则化方法用于缓解过拟合并提升泛化能力。常见手段包括权重衰减、随机失活、数据增强以及早停等。在大模型训练中,正则化的作用不仅体现在防止记忆噪声,也体现在保持表示空间的稳健性。
4 模型结构
4.1 编码器架构
编码器架构主要负责把输入映射为高维表示,适合做理解、分类和检索等任务。它通常以双向上下文建模为特点,能够整合输入中前后信息。由于输出更偏向特征而非连续生成,编码器在判别式任务中较常见。
4.2 解码器架构
解码器架构主要面向生成任务,按顺序逐步产生输出。它通常采用自回归方式,根据已有内容预测下一个单位。此类结构在文本续写、对话生成和代码生成等场景中应用广泛。
4.3 编码器-解码器架构
编码器-解码器架构将输入理解与输出生成结合起来,先由编码器提取源信息,再由解码器生成目标序列。它适合机器翻译、摘要生成和跨模态转换等任务。该结构兼顾表示能力与生成能力,因此在序列到序列任务中具有通用性。
4.4 参数规模与层数设计
参数规模和层数是模型容量的重要体现。一般而言,更深或更宽的网络能够容纳更复杂的模式,但也会带来训练难度和计算压力。设计时需要在表达能力、收敛速度与部署成本之间取得平衡。
4.5 注意力机制
注意力机制使模型能够动态关注输入中不同部分的重要性,是现代预训练模型的重要组成。它有效增强了长距离依赖建模能力,并提高了并行计算效率。
4.5.1 自注意力
自注意力允许序列中的每个位置与同一序列的其他位置建立关联,从而获得全局上下文信息。它是 Transformer 架构的重要基础,能够较好处理长文本和复杂结构数据。
4.5.2 交叉注意力
交叉注意力用于连接两个不同来源的表示,例如将文本与图像特征对齐,或让解码器关注编码器输出。它在多模态模型和编码器-解码器结构中尤为重要,承担着信息融合的作用。
5 典型类型
5.1 语言预训练模型
语言预训练模型是最常见的一类,主要面向文本理解与生成。它们通过大规模语料学习语法、语义、篇章结构和知识关联,已成为自然语言处理的基础组件。
5.1.1 词向量模型
词向量模型将词语映射到连续向量空间中,使语义相近的词在空间中彼此接近。它解决了传统离散表示难以捕捉词义相似性的缺点,也为后续上下文建模奠定了基础。
5.1.2 上下文表示模型
上下文表示模型会根据词语所处环境生成不同表示,因此同一词在不同句子中可以对应不同向量。这类模型显著提升了歧义消解和语义理解能力,也推动了问答、阅读理解等任务的发展。
5.1.3 大语言模型
大语言模型通常具有更大的参数规模和更广泛的语料覆盖,能够完成更复杂的文本生成与推理类任务。它们常结合指令适配、对齐训练和后训练方法,以增强对话、创作和工具调用能力。
5.2 视觉预训练模型
视觉预训练模型主要从图像或视频中学习通用特征,广泛用于分类、检测、分割和图像检索等任务。它们通过大量视觉数据提取纹理、形状、空间关系和语义结构。
5.2.1 图像分类模型
图像分类模型通常学习将图像映射到类别标签,常作为视觉预训练的基础形态。通过大规模分类数据训练后,模型可迁移到更复杂的视觉理解任务。
5.2.2 目标检测模型
目标检测模型不仅识别图像中有哪些对象,还要定位它们的位置。预训练使其在面对复杂背景、尺度变化和遮挡情况时更具鲁棒性。
5.2.3 视觉基础模型
视觉基础模型通常以大规模数据和统一架构为基础,能够支持多种视觉任务。它们的特点是通用性较强,可通过少量适配完成不同应用。
5.3 多模态预训练模型
多模态预训练模型试图同时处理两种或多种信息形式,例如文本、图像、语音和视频。其目标不仅是分别理解各模态内容,还包括建立模态之间的对应关系。
5.3.1 文图模型
文图模型通过联合学习文本和图像表示,实现图文检索、图像描述和跨模态问答等功能。它们在视觉语义对齐方面具有代表性。
5.3.2 语音文本模型
语音文本模型将语音信号与文字序列联系起来,可用于语音识别、语音翻译和语音交互系统。其关键在于处理声学特征与语言结构之间的映射。
5.3.3 统一表征模型
统一表征模型尝试用同一套表示空间容纳不同模态信息,从而简化任务切换和跨模态推理。此类模型往往强调结构统一性与接口一致性。
6 适配与应用
6.1 微调方法
微调是将预训练模型适配到特定任务的常用方式。它通过在目标数据上继续训练,使模型保留通用能力的同时,学习任务相关知识。
6.1.1 全参数微调
全参数微调会更新模型的全部权重,通常能获得较强的任务适配效果。其代价是计算和存储开销较大,更适合有较多资源的场景。
6.1.2 参数高效微调
参数高效微调只更新部分参数或添加少量新参数,例如适配器、前缀或低秩结构。它降低了训练成本,也方便在多个任务间切换。
6.1.3 迁移学习
迁移学习强调将已学到的知识转移到新任务中。预训练模型本质上就是迁移学习的重要载体之一,能够减少对大规模标注数据的依赖。
6.2 提示工程
提示工程通过设计输入提示,引导模型完成特定任务,而不一定需要额外训练。它在大语言模型应用中尤为常见。
6.2.1 零样本提示
零样本提示是指不给模型示例,只通过自然语言指令说明任务要求。它检验模型的通用理解能力,也常用于快速试验新任务。
6.2.2 少样本提示
少样本提示在提示中加入少量示例,帮助模型把握任务格式和输出风格。相比零样本方式,它通常能获得更稳定的结果。
6.2.3 链式提示
链式提示强调逐步引导模型进行分解推理或分段输出。它常用于复杂问题处理,使模型先展开中间步骤,再给出最终结果。
6.3 下游任务应用
预训练模型的应用范围十分广泛,几乎覆盖了常见的文本和视觉智能任务。
6.3.1 文本分类
文本分类用于判断文本所属类别,例如主题识别、情感分析或意图判定。预训练模型在该任务上通常能较快达到较高精度。
6.3.2 机器翻译
机器翻译将一种语言转换为另一种语言,要求模型同时掌握语义理解与目标语言生成。预训练有助于提升低资源语言或复杂句式下的翻译表现。
6.3.3 信息检索
信息检索关注从大规模文档中找到与查询相关的内容。预训练模型可用于查询理解、文档表示和排序优化,从而提高检索准确性。
6.3.4 内容生成
内容生成包括写作、摘要、对话、代码生成等多种形式。预训练模型在此类任务中能够利用学到的语言模式生成连贯文本。
6.3.5 图像识别与理解
图像识别与理解任务涵盖分类、定位、描述和场景分析等。视觉预训练模型可在这些任务中提供高质量特征基础,并提升对复杂图像的识别能力。
7 评估与基准
7.1 评估指标
评估指标用于衡量模型在预训练或下游任务中的表现,既要关注准确性,也要关注生成质量与概率建模能力。
7.1.1 准确率
准确率用于衡量预测正确的比例,适合类别较均衡的任务。它简单直观,因此常用于分类和识别类评估。
7.1.2 F1 值
F1 值综合考虑精确率与召回率,适用于类别不均衡或更重视检出效果的任务。它能比单一准确率更全面反映模型性能。
7.1.3 困惑度
困惑度常用于语言建模,表示模型对数据分布的不确定程度。数值越低,通常意味着模型对序列的预测越稳定。
7.1.4 生成质量指标
生成质量指标用于评价文本或图像生成结果的流畅度、一致性和与参考答案的接近程度。不同任务会采用不同指标组合,以避免单一指标失真。
7.2 基准测试
基准测试为模型提供统一对比环境,是衡量预训练模型进步的重要工具。
7.2.1 通用语言基准
通用语言基准通常覆盖阅读理解、常识问答、推理和文本分类等任务,用于检验语言模型的整体能力。
7.2.2 视觉基准
视觉基准主要评价模型在图像分类、目标识别、分割和视觉推理方面的表现,反映其对图像结构的理解程度。
7.2.3 多模态基准
多模态基准侧重考察模型在图文对齐、跨模态检索和多模态问答中的能力,能够体现其融合不同信息源的水平。
7.3 鲁棒性与泛化测试
鲁棒性与泛化测试关注模型面对噪声、分布变化、对抗扰动或不同领域数据时的稳定表现。一个模型即使在标准测试集上得分较高,也可能在真实环境中因输入变化而性能下降,因此这类测试越来越受到重视。
8 优势与局限
8.1 主要优势
预训练模型的优势主要体现在知识迁移、数据效率和任务覆盖范围三个方面。
8.1.1 知识迁移
模型能够把在通用语料中学到的结构知识迁移到具体任务上,从而减少重复学习的成本。对于样本较少的应用,这一特性尤其重要。
8.1.2 数据效率提升
由于模型先行学习了通用表示,下游任务往往只需较少标注数据即可达到可用效果。这使得预训练模型在数据稀缺场景中具有明显优势。
8.1.3 适用范围广
同一基础模型可以通过不同适配方式服务多个任务,因而具备较强的通用性。无论是理解、生成还是跨模态任务,预训练模型都能提供统一的技术底座。
8.2 主要局限
尽管优势明显,预训练模型也存在若干现实限制。
8.2.1 计算资源消耗
大规模预训练通常需要大量算力、存储和能源投入,训练成本较高,更新与迭代也不够轻便。
8.2.2 偏差与幻觉问题
模型可能继承训练数据中的偏差,或在生成时产生看似合理但实际错误的内容。此类问题会影响系统可信度,需要通过数据治理和后训练加以缓解。
8.2.3 可解释性不足
预训练模型内部参数众多,决策过程较难直观追踪,导致其输出有时难以解释。这给调试、审计和风险控制带来挑战。
8.2.4 领域适配困难
在某些专业领域,通用预训练模型未必能直接达到高水平效果。若目标领域术语密集、结构特殊或数据分布差异较大,往往仍需额外适配。
9 相关技术
9.1 迁移学习
迁移学习是一种将已有知识应用到新任务的方法。预训练模型与迁移学习关系密切,可以看作其在深度学习时代的重要实现形式。
9.2 自监督学习
自监督学习通过数据自身构造训练信号,无需大量人工标签。许多预训练方法都建立在自监督学习基础上,因此二者常被并列讨论。
9.3 半监督学习
半监督学习结合少量标注数据与大量未标注数据进行训练。它常用于标注成本较高的场景,与预训练模型的适配方式具有互补关系。
9.4 表示学习
表示学习的目标是让模型自动提取有用特征,而不是依赖人工设计。预训练模型的核心价值,很大程度上就体现在更高质量的表示学习能力上。
9.5 强化学习与后训练
强化学习与后训练常用于进一步调整模型行为,使其更符合任务目标或交互需求。它们通常发生在预训练之后,帮助模型在安全性、可控性和偏好对齐方面继续优化。
10 工程实现
10.1 训练框架
工程上,预训练模型通常依托成熟的深度学习框架实现训练、分布式通信与参数管理。训练框架不仅要支持大规模并行,还要便于日志记录、断点恢复和实验复现。
10.2 模型压缩
模型压缩用于降低模型体积和推理成本,使其更适合部署和实时应用。
10.2.1 剪枝
剪枝通过移除冗余参数或连接,减少模型复杂度。合理剪枝后,模型体积可下降,同时尽量保持性能不明显损失。
10.2.2 量化
量化将高精度参数或激活转换为低比特表示,以节省存储并提升推理效率。它在边缘设备和高并发服务中非常常见。
10.2.3 蒸馏
蒸馏通过让小模型学习大模型的输出分布或中间表示,压缩知识并保留部分能力。它适合在资源受限环境中部署较强模型。
10.3 部署与推理
部署阶段关注的是模型如何高效、稳定地提供服务。推理系统通常需要兼顾延迟、吞吐量与资源占用。
10.3.1 在线服务
在线服务强调实时响应,常用于问答、对话和搜索排序等交互式应用。它对延迟和稳定性要求较高。
10.3.2 边缘部署
边缘部署将模型放在终端或近端设备运行,便于降低通信成本并提升隐私性。其挑战主要在于设备算力有限。
10.3.3 批量推理
批量推理适合离线处理大规模数据,如文档分类、内容审核和数据分析。它更关注总体吞吐效率,而非单次响应速度。
11 未来发展
11.1 更大规模与更高效率
未来预训练模型可能继续在规模上扩展,但单纯增大参数已不再是唯一方向。更高效率的训练算法、更加优质的数据以及更低成本的推理方式,将与规模提升并行发展。
11.2 更强多模态能力
多模态模型将进一步加强对图像、语音、视频和文本的联合理解能力。随着跨模态对齐技术成熟,模型有望在更复杂的感知与推理任务中发挥作用。
11.3 个性化与可控生成
个性化与可控生成是预训练模型应用的重要方向。未来模型可能更容易根据用户偏好、任务约束或场景需求调整输出风格与内容边界。
11.4 安全性与可信性提升
随着应用范围扩大,模型的安全性、稳定性和可信性将成为关键议题。包括减少错误输出、控制偏差、增强可解释性以及提升可审计性在内的改进,将持续影响预训练模型的发展路径。