1 基本概念

1.1 定义与内涵

1.1.1 增量学习的基本定义

增量学习是一种面向持续变化数据流的机器学习范式。模型在接收新样本、新任务或新类别后,不必从头训练,而是在已有参数和知识基础上进行更新。其核心在于“边学边改”,使系统能够随着环境变化不断完善自身。

1.1.2 与一次性离线训练的区别

一次性离线训练通常假设训练数据在开始时已基本齐备,模型训练完成后再固定部署。增量学习则强调分阶段接收数据,并在后续阶段继续优化。前者更适合数据静态、任务固定的场景,后者更适合数据持续到达、需求不断演化的环境。

1.2 核心目标

1.2.1 保留旧知识

增量学习要求模型在学习新内容时,尽量维持对旧知识的识别和推断能力。这种保持并非完全冻结参数,而是在更新过程中避免历史经验大幅退化。

1.2.2 学习新知识

模型不仅要记住过去,还要对新增信息做出有效吸收。无论是新增类别、变化后的分布,还是新的任务目标,系统都应具备快速适应能力。

1.2.3 平衡稳定性与可塑性

稳定性指对已有知识的维持能力,可塑性则指吸收新知识的灵活性。增量学习的难点就在于两者常常相互制约,提升一方可能会削弱另一方,因此需要在训练策略上寻找折中。

1.3 相关术语

1.3.1 持续学习

持续学习通常强调模型在较长时间跨度内不断获得新知识,并尽可能维持旧知识。它与增量学习关系密切,常被视为同一研究方向下的不同表述。

1.3.2 在线学习

在线学习指模型按数据到达顺序逐步更新,常见于流式数据处理。与一般增量学习相比,在线学习更强调实时性和单样本或小批量更新。

1.3.3 终身学习

终身学习强调智能体在整个生命周期中不断积累经验。它不仅关注分类或预测精度,也关注知识迁移、经验复用和长期适应能力。

1.3.4 逐步学习与阶段式学习

逐步学习通常指按小步长持续更新模型;阶段式学习则指将数据或任务分为若干阶段进行训练。这两种说法都描述了非一次性训练的过程,但侧重点略有不同。

2 发展背景

2.1 机器学习的发展需求

2.1.1 数据持续增长

随着传感器、平台与业务系统不断产生新数据,训练集往往不再是静态集合,而是持续扩充的流。模型若只能固定训练,就难以跟上数据规模与内容变化。

2.1.2 任务环境不断变化

现实场景中的任务目标、输入特征和数据分布经常发生调整。例如图像识别中的拍摄条件变化、推荐系统中的用户兴趣转移,都会使旧模型逐渐失效。

2.1.3 模型部署后的持续更新需求

许多模型在部署后仍需长期运行,且难以频繁重新收集全部历史数据进行重训。因此,具备后续更新能力的学习方式更符合工程实践。

2.2 传统训练范式的局限

2.2.1 重新训练成本高

当新数据到来后,如果采用完整重训,通常需要大量算力、时间和人工管理成本。在大规模模型或高频更新场景中,这种代价尤为明显。

2.2.2 历史数据保存受限

在一些应用中,旧数据无法长期保存,原因可能包括存储容量、隐私约束或数据过期。模型无法反复访问完整历史集,便需要借助增量机制维持性能。

2.2.3 旧知识易丢失

普通训练过程若只关注新数据,很容易让模型把先前学到的模式“冲掉”。这种现象会导致旧任务表现下降,形成明显的知识退化。

2.3 增量学习的研究动机

2.3.1 资源受限场景适配

在终端设备、边缘节点或计算预算有限的条件下,持续重训并不现实。增量学习因此成为更符合资源约束的方案。

2.3.2 长周期智能系统需求

机器人、监测系统和交互式应用往往需要长期运行,并不断适应新情况。增量学习为这类系统提供了持续演化的能力。

2.3.3 多阶段知识积累

知识并不总是一口气获得,而是逐步形成。增量学习试图模拟这种积累过程,让模型像“边经历边成长”一样逐层扩展能力。

3 问题类型

3.1 类增量学习

3.1.1 新类别不断加入

类增量学习关注的是类别集合不断扩张的情形。模型在学习新类别时,需要理解这些类别与旧类别之间的边界关系。

3.1.2 旧类别保持识别能力

在新类别加入后,模型仍应能识别先前学过的类别,否则就会出现明显遗忘。该问题在图像分类中尤为常见。

3.2 任务增量学习

3.2.1 多任务顺序学习

任务增量学习指模型按顺序学习多个不同任务,每个任务可能具有不同输出空间或目标函数。模型需要在任务切换时维持适应性。

3.2.2 任务边界已知与未知情形

有些设置中,系统能明确知道当前属于哪个任务;另一些情况下,任务边界并不显式存在。后者更接近真实环境,也更具挑战性。

3.3 域增量学习

3.3.1 数据分布逐步变化

域增量学习强调同一任务下输入分布持续变化,例如图像风格、噪声水平或采集设备发生改变。模型要学会适应这些“域差异”。

3.3.2 同一任务下环境漂移

即使任务目标不变,环境也可能缓慢漂移。域增量学习主要处理这种渐变式变化,而不是新增完全不同的任务。

3.4 样本增量学习

3.4.1 数据按批次到达

样本增量学习中,数据不是一次性提供,而是按批次逐渐进入系统。模型需要利用新批次继续优化,而不破坏前期学习结果。

3.4.2 样本规模持续扩展

随着样本不断累积,训练集规模增加,模型要在有限资源下完成更新。这类方法常见于流式分析和长期监测场景。

4 关键挑战

4.1 灾难性遗忘

4.1.1 旧知识性能下降

灾难性遗忘指模型在学习新内容后,对旧任务或旧类别的表现显著恶化。这是增量学习最核心的问题之一。

4.1.2 参数更新冲突

新任务优化往往会调整与旧任务相关的参数方向,造成目标冲突。若缺乏约束,模型容易偏向新数据分布而忽略历史信息。

4.2 类间不平衡

4.2.1 新旧类别样本数量失衡

在增量场景中,新数据往往比旧数据更容易获取,导致训练样本分布不均。样本失衡会让模型对新类别过度敏感。

4.2.2 决策偏置问题

当模型长期接触新类别而旧类别样本稀少时,输出层可能形成偏置,进而更倾向预测新类。这会影响整体分类公平性

4.3 数据与存储限制

4.3.1 历史样本难以长期保存

完整保留所有旧数据并不总是可行,尤其在存储成本高或数据涉及保密约束时更是如此。于是,模型必须在“少量记忆”中维持能力。

4.3.2 记忆容量受限

许多方法依赖记忆库保存少量代表样本,但记忆大小有限。如何选取最有价值的样本,成为性能与资源之间的重要权衡。

4.4 计算与部署成本

4.4.1 训练时间增加

增量训练通常需要多轮更新和额外约束,因此总训练时间可能高于一次性训练。若更新频繁,成本还会进一步上升。

4.4.2 模型规模膨胀

部分方法通过增加网络结构来避免遗忘,但这也可能带来参数数量增长。模型越大,部署与维护越复杂。

4.5 评估复杂性

4.5.1 不同阶段性能比较

增量学习需要同时观察多个阶段的性能,不能只看最终结果。因为模型在某一阶段表现良好,并不代表整体历史任务都稳定。

4.5.2 遗忘程度量化

如何准确衡量模型忘记了多少旧知识,是评估中的难点。不同指标和实验设置可能给出不同结论,使比较变得复杂。

5 主要方法

5.1 基于正则化的方法

5.1.1 参数重要性约束

这类方法会评估参数对旧任务的重要程度,并在更新时限制关键参数的剧烈变化。其思路是让“重要的连接”尽量保持稳定。

5.1.2 权重惩罚与稳定更新

通过在损失函数中加入惩罚项,模型可被引导避免过度偏离旧参数。这样既能学习新信息,也能减少对旧知识的破坏。

5.2 基于回放的方法

5.2.1 经验回放

经验回放会保留一部分旧样本,在训练新任务时与新数据一起使用。它相当于让模型“回顾旧课”,从而减轻遗忘。

5.2.2 生成式回放

当真实样本难以保存时,可以用生成模型合成近似旧数据,再用于训练。这种方式减少了对历史数据存储的依赖。

5.2.3 记忆样本选择策略

由于记忆空间有限,系统通常要挑选最具代表性的样本保存。选择方式可能基于多样性、难度、置信度或类别均衡等原则。

5.3 基于蒸馏的方法

5.3.1 知识蒸馏保持旧输出

知识蒸馏通过让新模型尽量模仿旧模型的输出分布,来保留历史行为模式。它不仅关注分类结果,也关注输出概率结构。

5.3.2 响应保持与特征保持

有些方法不仅蒸馏最终响应,还约束中间表示尽量一致。这样可以从更深层次维持旧知识的语义结构。

5.4 基于结构扩展的方法

5.4.1 动态增加网络参数

当原有网络容量不足时,可通过增加层、节点或分支来容纳新知识。这种方式减少了对旧参数的直接干扰。

5.4.2 模块化网络设计

模块化设计将不同任务或知识片段分配给不同子模块,便于局部更新。结构清晰的模块也更利于后续复用。

5.4.3 路由与门控机制

路由和门控机制负责决定当前输入应该经过哪些模块。它们有助于在复杂任务中实现更精细的知识调用。

5.5 基于提示与表示学习的方法

5.5.1 提示参数更新

这类方法借助可学习提示引导模型适应新任务,而尽量少改动主体参数。它常用于参数高效的持续更新。

5.5.2 特征空间重构

通过调整表示空间结构,使新旧样本在特征层面保持更合理的分布关系,可减轻类别冲突和表征漂移。

5.5.3 原型表示维护

原型表示会用每个类别或任务的代表向量概括知识。持续维护这些原型,有助于模型快速回忆历史概念。

6 典型流程

6.1 数据到达与任务划分

6.1.1 顺序批次输入

增量学习流程通常从按批次接收数据开始。每一批数据可能包含新类别、新样本或新的环境信息。

6.1.2 任务边界设定

在实验或系统设计中,任务边界可以预先定义,也可以由数据流自然形成。边界的设定会直接影响训练和评估方式。

6.2 模型初始化

6.2.1 预训练模型使用

许多增量系统会先加载预训练模型作为初始基础,以获得较好的通用表示能力。这有助于后续快速适应新阶段数据。

6.2.2 初始类别学习

在开始增量更新前,模型通常先学习一组初始类别或基础任务。该阶段决定了后续扩展的起点。

6.3 增量更新阶段

6.3.1 新知识注入

系统在接收新数据后,会针对新增内容进行训练,使模型逐步覆盖新的类别或任务需求。

6.3.2 旧知识保持

更新过程中往往同步加入约束、回放或蒸馏机制,以维持旧知识表现,避免性能塌陷。

6.3.3 记忆库维护

若方法依赖记忆库,就需要在每轮更新后调整样本集合。维护策略通常要兼顾代表性、平衡性和容量限制。

6.4 迭代优化与评估

6.4.1 阶段性验证

在每个增量阶段结束后,模型都会进行验证,以观察当前阶段与历史阶段的综合效果。

6.4.2 遗忘监测

遗忘监测用于追踪旧任务性能变化,帮助研究者判断模型是否出现明显退化。

6.4.3 性能回顾与调参

根据验证结果,系统可能重新调整学习率、记忆规模或正则强度等参数,以提高整体表现。

7 评价指标

7.1 准确率类指标

7.1.1 各阶段平均准确率

该指标统计模型在所有阶段上的平均表现,能更全面反映长期学习效果,而不只看单次结果。

7.1.2 最终准确率

最终准确率主要衡量完成全部增量阶段后的总体性能,适合观察模型在任务结束时的综合水平。

7.2 遗忘相关指标

7.2.1 平均遗忘率

平均遗忘率用于描述模型在多个旧任务上的性能下降幅度。数值越小,说明保持能力越强。

7.2.2 任务保持率

任务保持率关注模型对早期任务的持续识别能力,可作为遗忘问题的补充度量。

7.3 资源效率指标

7.3.1 训练时间

训练时间反映增量更新的计算开销。对于频繁更新的系统,这一指标尤为重要。

7.3.2 存储开销

存储开销通常包括模型参数、记忆样本和辅助缓存等。对于边缘设备和嵌入式系统,存储约束常是关键限制。

7.3.3 推理延迟

推理延迟指模型对单次输入给出结果所需的时间。若模型结构过于复杂,部署体验可能受影响。

7.4 综合评估方式

7.4.1 稳定性-可塑性权衡

综合评估常用来观察模型是否能在稳定旧知识的同时快速吸收新知识。二者通常不能同时达到极端最优,因此需平衡分析。

7.4.2 长期性能曲线

长期性能曲线展示模型在多个阶段中的变化轨迹。相比单点指标,它更能体现增量学习的动态特征。

8 应用领域

8.1 计算机视觉

8.1.1 类别逐步扩展识别

在视觉分类中,新类别可能按阶段不断加入。增量学习可帮助模型在扩充类别空间时维持识别稳定性。

8.1.2 持续目标分类

目标检测或细粒度识别中,目标类别可能逐步丰富。模型需要在新目标出现后继续保持对旧目标的判断能力。

8.2 自然语言处理

8.2.1 词汇与任务扩展

自然语言系统常需处理新词、新表达和新任务。增量学习可以让语言模型在词表演化或任务增加时继续更新。

8.2.2 领域适配

同一语言模型在不同领域中可能面临术语差异和风格变化。通过增量方式适配,可减少从零训练的成本。

8.3 推荐系统

8.3.1 用户兴趣动态更新

用户兴趣会随着时间变化,推荐模型需要及时调整偏好估计。增量学习有助于让系统保持推荐新鲜度。

8.3.2 新物品持续加入

商品、内容或服务常不断上新,推荐系统需要迅速纳入这些项目。增量学习可使模型尽快理解新物品特征。

8.4 机器人与边缘智能

8.4.1 在线环境适应

机器人在真实环境中可能遭遇光照、地形或交互对象的变化。增量学习可帮助其逐步适应现场条件。

8.4.2 本地设备增量更新

边缘设备通常算力有限,不适合频繁大规模重训。轻量化增量更新因此更具实用价值。

8.5 工业与监测系统

8.5.1 设备状态演化识别

工业设备的运行状态会随着时间、负载和磨损而变化。增量学习可用于持续识别这些状态演化。

8.5.2 异常模式持续学习

异常模式并不总是固定不变,新的故障特征可能不断出现。模型需要在长期监测中逐步吸收新异常样式。

9 研究进展

9.1 经典阶段

9.1.1 早期增量分类方法

早期研究主要集中在分类任务上,通过简单的样本保留和分类器更新来减少遗忘。这些方法奠定了后续研究基础。

9.1.2 记忆与正则化基础

随后,研究者逐渐引入记忆库和参数约束机制,使模型在更新时具有更强的历史保持能力。

9.2 深度学习阶段

9.2.1 深层表示学习结合

深度学习的发展推动了增量学习与表示学习的融合。模型不再只处理浅层特征,而是尝试维护更稳定的深层语义表示。

9.2.2 大模型适配思路

随着模型规模增大,如何对大型网络进行高效增量更新成为新问题。研究开始关注参数高效调节与模块化适配。

9.3 近期发展

9.3.1 提示学习与参数高效更新

提示学习通过少量可训练参数实现快速适应,因其更新轻量而受到关注。它适合需要频繁扩展的场景。

9.3.2 生成模型辅助回放

生成模型可用于构造历史样本近似,从而在不保存全部原始数据的情况下辅助回放。这提高了方法的灵活性。

9.3.3 开放世界与持续适应

近期研究逐渐从封闭类别集合走向开放世界设定,即系统不仅要学会已知类别,还要持续应对未知内容和环境变化。

10 未来方向

10.1 更强的抗遗忘能力

10.1.1 长时序知识保持

未来研究将更重视长时间跨度内的稳定记忆,尤其是在大量阶段迭代后仍能保留核心知识。

10.1.2 更高效记忆机制

如何用更小的存储代价保存更有代表性的历史信息,是提升抗遗忘能力的重要方向。

10.2 低资源增量学习

10.2.1 轻量化更新

未来方法可能进一步减少训练步数、参数改动和辅助开销,使增量更新更适合实时系统。

10.2.2 边缘设备部署

在终端和边缘场景中,算法需要兼顾准确率、延迟与功耗。适配本地部署将成为实用研究重点。

10.3 通用评测体系

10.3.1 标准数据协议

统一的数据划分和实验协议有助于不同方法之间的公平比较,也能减少结果受设置差异影响的问题。

10.3.2 可复现实验设置

可复现的实验流程能够提升研究结果可信度,让不同团队在相近条件下进行验证和对照。

10.4 与基础模型结合

10.4.1 预训练模型持续适配

基础模型具备较强通用能力,若能与增量学习结合,可在保持通用性的同时持续适应新任务。

10.4.2 少样本增量扩展

未来还可能进一步探索在极少新样本条件下的增量扩展,使模型以更低代价获取新知识。