1 定义与基本概念
1.1 扩散模型的定义
扩散模型是一类以逐步加噪和逐步去噪为核心的生成式机器学习方法。它通过学习从噪声恢复数据的过程,实现对图像、音频、视频等样本的生成与重建。与一次性直接生成不同,这类模型通常将复杂分布拆解为多个连续的小步骤,因此在训练和采样上具有较强的可控性。
1.2 核心思想
扩散模型的基本思路是:先把真实数据逐渐扰动成近似随机噪声,再训练模型学习如何从噪声中逆向恢复出原始样本。这个过程可理解为“先破坏,再重建”,其生成质量在很多任务中表现突出。
1.2.1 正向扩散过程
正向扩散过程是指在一系列时间步中向样本中持续加入噪声,使其分布逐渐趋近于简单的高斯噪声。该过程通常是预先定义的,不需要模型去学习,主要作用是构造一个从数据到噪声的转化路径。
1.2.2 反向生成过程
反向生成过程是模型学习的重点,即从纯噪声出发,逐步估计并去除噪声,最终得到符合数据分布的样本。由于每一步只需恢复一小部分信息,因此生成结果往往细节丰富,且可通过条件信息进行控制。
1.3 与其他生成模型的关系
扩散模型与生成对抗网络、自回归模型、变分自编码器都同属生成建模范畴,但其建模方式不同。它更强调逐步转化和概率推断,而不是单次映射或逐点预测。
1.3.1 与生成对抗网络的区别
生成对抗网络通过生成器和判别器之间的对抗训练来学习数据分布,而扩散模型通常依赖去噪目标进行优化。前者在采样时速度较快,但训练中可能出现不稳定现象;后者训练相对平稳,但采样往往更耗时。
1.3.2 与自回归模型的区别
自回归模型按照固定顺序逐个生成元素,例如按像素、词元或帧依次输出。扩散模型则是在整体上对样本进行多轮修正,不要求严格的单向顺序,因此更适合处理连续结构与高维视觉内容。
1.3.3 与变分自编码器的联系
扩散模型与变分自编码器都包含潜变量或潜空间表示,并带有概率建模色彩。不同之处在于,变分自编码器通常通过编码器和解码器建立压缩表示,而扩散模型更侧重于噪声演化与逆向恢复。
1.4 基本术语
扩散模型文献中常使用若干固定术语,用以描述噪声控制、条件约束和生成路径。
1.4.1 噪声调度
噪声调度指在不同时间步中加入噪声的大小安排。它决定了数据向噪声退化的速度,也会影响训练难度、采样质量和生成稳定性。
1.4.2 潜变量
潜变量是指在建模过程中用于表示隐含信息的中间变量。在扩散模型中,它既可能对应噪声状态,也可能对应压缩后的低维表征。
1.4.3 条件生成
条件生成是指在额外输入信息的约束下进行样本生成,例如类别标签、文本描述或参考图像。该机制能让生成结果更符合任务要求,也便于实现定向编辑。
2 理论基础
2.1 随机过程
扩散模型的理论基础与随机过程密切相关。其正向与反向步骤都可视为带有随机性的动态演化,因此常借助概率论工具加以描述。
2.1.1 马尔可夫链
马尔可夫链是扩散模型中常见的建模框架之一,强调当前状态只依赖于前一状态,而与更早历史无关。这个性质使多步噪声添加和去噪过程易于分析,也便于构造逐层转移规则。
2.1.2 随机微分方程
在连续时间形式下,扩散过程可以用随机微分方程描述。这类表示将离散时间步推广到连续演化,使模型能够从更统一的角度理解扩散、得分估计与逆向采样之间的关系。
2.2 概率密度估计
扩散模型的目标之一是学习数据分布的概率结构,从而能够从噪声中恢复出符合真实分布的样本。
2.2.1 最大似然思想
最大似然思想要求模型提高训练数据在所学分布下的出现概率。扩散模型常通过构造等价或近似的优化目标,间接实现这一目的,并在大规模数据上取得较好效果。
2.2.2 变分下界
变分下界常用于把难以直接计算的对数似然转化为可优化的下界形式。扩散模型在离散框架中经常借助这一思想,将整体生成问题分解为多个局部可处理的项。
2.3 去噪学习原理
去噪学习是扩散模型的核心训练机制。模型通过观察不同噪声水平下的数据,学习如何恢复干净信号。
2.3.1 预测噪声
预测噪声是最常见的训练方式之一,模型直接输出当前样本中所含噪声的估计值。该策略通常数值稳定,也便于与不同时间步结合。
2.3.2 预测原始样本
另一种方式是让模型直接预测最初的干净样本。此类目标更直观,但在某些设定下可能对噪声水平更敏感,因此常与其他参数化方式结合使用。
2.3.3 预测速度场
在连续形式中,模型还可以学习样本在状态空间中的变化方向,即速度场或流场。此方法与常微分方程或流匹配思想相近,有助于构造更高效的生成过程。
2.4 热力学与物理启发
扩散模型的概念在一定程度上受到物理过程的启发,尤其是热扩散、熵增和系统平衡等直观类比。
2.4.1 扩散与熵增
正向加噪可类比为系统向更无序状态演化,体现出信息逐步损失和熵增的特征。样本经过多轮扰动后,结构信息被稀释,最终接近简单噪声分布。
2.4.2 平衡态与逆过程
逆向生成过程可看作从无序状态向有序结构恢复的过程。模型通过学习这一逆过程,将噪声重新组织为具有语义和结构的信息样本。
3 模型结构
3.1 正向扩散模块
正向扩散模块负责定义样本如何逐步变为噪声,通常不需要复杂参数,仅通过预设规则执行。
3.1.1 噪声添加机制
噪声添加机制决定每一步向输入中注入多少随机扰动。常见做法是按固定或函数化的噪声强度序列,对样本进行逐级污染。
3.1.2 时间步建模
时间步建模用于标识当前样本处于哪一阶段。由于不同阶段的噪声水平不同,模型必须获知时间信息,才能采取合适的去噪策略。
3.2 反向去噪网络
反向去噪网络是扩散模型的核心参数部分,负责根据当前噪声状态预测下一步更干净的表示。
3.2.1 U-Net结构
U-Net结构因其多尺度特征提取与跳跃连接设计而被广泛采用。它既能保留局部细节,又能汇聚全局上下文,适合图像类扩散任务。
3.2.2 注意力机制
注意力机制有助于模型在较大范围内建立依赖关系,提升对复杂结构和长距离关联的建模能力。在高分辨率生成任务中,这一机制常用于增强语义一致性。
3.2.3 时间嵌入
时间嵌入将扩散步数编码为可供网络使用的向量表示。通过注入时间信息,模型可以区分不同噪声水平下的输入,并输出相应的去噪结果。
3.3 条件控制模块
条件控制模块用于将外部信息纳入生成过程,从而实现更准确的定向输出。
3.3.1 类别条件
类别条件利用标签信息限定生成样本所属类别,例如动物、交通工具或手写数字。这种方式能够显著提高目标一致性。
3.3.2 文本条件
文本条件通过自然语言描述对生成内容进行约束,常见于文生图任务。模型需要将语言语义与视觉结构进行对齐,才能输出符合描述的结果。
3.3.3 图像条件
图像条件以参考图像作为输入,引导模型完成修复、变换或重绘等任务。它适合局部编辑、风格转换以及结构保持类应用。
3.4 潜空间扩散
潜空间扩散是在压缩后的潜表示上进行扩散建模的一种方法,目的是降低计算开销并提升效率。
3.4.1 编码器与解码器
编码器先将高维输入压缩到潜空间,解码器再把生成结果还原回原始空间。通过这种前后处理,模型可以在更紧凑的表示上完成生成。
3.4.2 低维生成空间
低维生成空间保留了主要语义信息,同时减少了运算量。相比直接在像素空间扩散,这种方式通常更适合高分辨率内容生成。
4 训练方法
4.1 训练目标设计
扩散模型的训练目标通常围绕噪声恢复、分布估计和变分优化展开,不同参数化方式对应不同损失形式。
4.1.1 均方误差目标
均方误差目标是最常用的训练方式之一,模型学习预测噪声或相关变量,并通过误差最小化逐步优化。该目标简单直观,且通常较易收敛。
4.1.2 变分目标
变分目标来自概率建模中的下界优化思想,常用于连接生成概率与训练损失。它能够从理论上解释模型如何逼近真实数据分布。
4.2 数据准备
高质量的数据准备对扩散模型尤为重要,因为其训练会直接学习数据的统计结构。
4.2.1 训练集构建
训练集构建包括样本筛选、格式统一和标注整理等步骤。对于条件扩散模型,还需确保文本、类别或其他条件与样本匹配。
4.2.2 数据增强
数据增强可通过裁剪、翻转、缩放或颜色扰动等手段扩大样本多样性。适度增强有助于提升模型泛化能力,但也需要避免破坏关键语义。
4.3 优化策略
扩散模型通常依赖大规模迭代训练,因此优化设置对结果影响明显。
4.3.1 学习率调度
学习率调度用于控制训练过程中的步长变化。合理的调度策略可以帮助模型在早期快速学习,在后期稳定收敛。
4.3.2 批量训练
批量训练通过一次处理多个样本来提升训练效率和梯度估计稳定性。较大的批量通常更利于并行计算,但也会增加资源消耗。
4.4 采样与推断
采样阶段决定模型如何从噪声生成最终样本,是扩散模型区别于许多传统生成方法的重要环节。
4.4.1 迭代采样
迭代采样要求模型经过多个去噪步骤逐步恢复图像或其他目标。虽然过程较长,但每一步都较容易控制,因此输出质量通常较高。
4.4.2 加速采样方法
加速采样方法旨在减少生成所需的时间步数,常通过重参数化、跳步或数值求解优化来实现。其目标是在速度与质量之间取得平衡。
4.4.3 指导采样
指导采样利用额外条件或引导信号,使生成结果更贴近预期目标。它常用于文本约束、类别控制以及图像编辑等场景。
4.5 训练稳定性
扩散模型一般被认为比对抗式方法更稳定,但在实际训练中仍需注意数值与参数设置。
4.5.1 梯度裁剪
梯度裁剪用于限制梯度过大带来的训练波动。该技术可防止参数更新异常,提升整体收敛稳定性。
4.5.2 噪声参数选择
噪声参数选择直接影响扩散路径和学习难度。若噪声过强,恢复任务会变得困难;若过弱,则模型可能难以形成充分的生成能力。
5 主要变体
5.1 DDPM
DDPM是扩散模型中最具代表性的离散时间框架之一,为后续研究提供了标准化的建模范式。
5.1.1 标准离散扩散框架
该框架将扩散过程划分为有限个时间步,在每一步执行预定义的加噪与学习到的去噪操作。其结构清晰,便于推导和实现。
5.1.2 经典训练与采样流程
DDPM的经典流程包括前向加噪、噪声预测训练以及逐步反向采样。虽然生成速度较慢,但通常能够获得较高保真度的样本。
5.2 DDIM
DDIM是在采样阶段对扩散过程进行改造的一种方法,重点在于提高推断效率。
5.2.1 非马尔可夫采样
DDIM允许在采样时采用非马尔可夫式的路径设计,不再严格依赖逐步随机转移。这样可以在较少步骤内完成生成,同时保持较好的样本质量。
5.2.2 速度与质量权衡
DDIM通常通过减少采样步数来提升速度,但步数压缩过多时可能损失细节。因此实际使用中需要根据任务要求选择合适的平衡点。
5.3 Score-based模型
Score-based模型以数据分布的得分函数为核心,强调学习概率密度的梯度信息。
5.3.1 得分匹配
得分匹配通过估计数据分布对输入的梯度,帮助模型学习如何朝更高概率区域移动。它与去噪学习在形式上具有紧密联系。
5.3.2 逆向随机微分方程
在连续时间框架下,Score-based模型可通过逆向随机微分方程实现采样。该视角使模型与随机过程理论、数值求解方法联系更为紧密。
5.4 潜空间扩散模型
潜空间扩散模型将扩散过程转移到压缩表示上,以提升效率并降低算力需求。
5.4.1 高效图像生成
由于在低维空间中运算,潜空间扩散通常比像素级扩散更高效,适合高分辨率图像生成与批量应用。
5.4.2 压缩表示学习
此类模型依赖编码器学习紧凑表示,使主要语义信息得以保留。压缩表示的质量会直接影响最终生成图像的清晰度与细节。
5.5 条件扩散模型
条件扩散模型通过外部信息控制生成内容,是扩散模型应用扩展的重要方向。
5.5.1 类别引导
类别引导使模型按照指定标签生成样本,常见于图像分类数据集上的定向生成。它能够提升类别准确率和可控性。
5.5.2 文本到图像生成
文本到图像生成将自然语言转化为视觉内容,是条件扩散模型最受关注的应用之一。该任务要求模型同时理解语言语义、场景结构与视觉细节。
6 采样与推理
6.1 逐步去噪过程
扩散模型在推理阶段通常从随机噪声开始,通过多轮修正得到最终输出。
6.1.1 从纯噪声开始生成
生成过程通常以纯噪声作为初始状态,这意味着模型不依赖具体起点,而是从无结构分布中逐步构建目标样本。
6.1.2 中间状态演化
在采样过程中,中间状态会从粗糙轮廓逐渐过渡到清晰细节。前期主要形成整体结构,后期则补充纹理、边缘和局部特征。
6.2 采样加速
采样加速是扩散模型实用化的重要方向,因为传统多步采样在时间成本上较高。
6.2.1 减少时间步
减少时间步可以直接缩短生成过程,但也可能削弱最终质量。实际方案通常通过更聪明的步长设计尽量保留效果。
6.2.2 高阶求解器
高阶求解器借助更精细的数值方法近似逆向过程,从而在较少步骤下维持较好表现。该类方法适合连续时间扩散框架。
6.3 引导技术
引导技术通过额外信号强化采样方向,使输出更符合条件或偏好。
6.3.1 分类器引导
分类器引导利用外部分类器提供梯度信息,推动样本朝目标类别靠近。它能够增强条件一致性,但也会增加系统复杂度。
6.3.2 无分类器引导
无分类器引导无需单独训练分类器,而是在训练或采样过程中结合有条件与无条件预测实现控制。该方法更简洁,也更易与大模型结合。
6.4 生成控制
生成控制关注如何在不完全重写内容的前提下,对样本进行定向修改。
6.4.1 强度控制
强度控制用于调节新生成内容对原始输入的保留程度。强度较高时改动更大,强度较低时则更接近原样本。
6.4.2 局部编辑
局部编辑只修改图像或其他数据中的特定区域,保留其余部分不变。该能力在修补、换背景和细节替换中较为常见。
6.4.3 结构约束
结构约束要求生成结果遵守边缘、深度、姿态等先验信息。它能帮助模型在创作自由与内容稳定之间取得平衡。
7 应用领域
7.1 图像生成
扩散模型在图像生成中应用最广,尤其擅长高细节和高分辨率输出。
7.1.1 文生图
文生图将文本描述转化为图像内容,能够实现场景构造、风格表达和对象组合等任务。该方向也是扩散模型最具代表性的应用之一。
7.1.2 风格迁移
风格迁移通过改变图像的视觉风格而尽量保留内容结构。扩散模型可在保持主体语义的同时,生成更自然的风格融合效果。
7.1.3 图像修复
图像修复用于补全缺失区域、修正损坏像素或去除干扰元素。扩散模型在纹理延展与结构一致性方面常有较好表现。
7.2 音频与音乐生成
扩散模型也可处理时间序列型的音频数据,并用于语音或音乐内容合成。
7.2.1 语音合成
语音合成可借助扩散模型生成自然度较高的语音波形或声学特征。相较传统方法,它在音色细节和音质平滑度方面具有一定优势。
7.2.2 音效生成
音效生成包括环境音、拟音和短促音频片段的制作。扩散模型能够根据文本或场景条件输出更贴近需求的声音素材。
7.3 视频生成
视频生成要求模型同时处理空间细节与时间连续性,因此难度高于静态图像生成。
7.3.1 时序一致性
时序一致性是视频生成中的关键指标,要求相邻帧之间过渡自然、对象状态稳定。扩散模型通过多帧联合建模来缓解闪烁和跳变问题。
7.3.2 运动建模
运动建模关注物体、镜头与背景的动态变化。合理的运动表示有助于生成更具真实感的连续画面。
7.4 科学与工程应用
扩散模型不仅用于艺术与媒体,也逐渐进入科学计算和工程设计场景。
7.4.1 分子生成
分子生成可用于寻找满足特定性质的候选结构。扩散模型能够在化学规则约束下提出新的分子构型。
7.4.2 材料设计
材料设计中,模型可辅助探索具备目标性能的材料组合与结构参数。这类应用常与实验筛选和数值模拟结合。
7.4.3 物理场模拟
物理场模拟利用扩散模型近似复杂场分布的生成过程,例如流体、温度或压力场。其优势在于可以在较低成本下得到高质量近似结果。
7.5 医学与生命科学
扩散模型在医学影像和生物数据处理中具有较强的建模潜力。
7.5.1 医学影像重建
医学影像重建可用于提高成像质量、补全缺失信息或增强分辨率。扩散模型在保持边缘与组织细节方面表现活跃。
7.5.2 生物序列建模
生物序列建模涉及DNA、RNA或蛋白质等序列数据的生成与优化。扩散模型能够在复杂约束下探索新的序列候选。
8 优势与局限
8.1 主要优势
扩散模型之所以受到关注,主要源于其生成效果、训练稳定性和控制能力的综合表现。
8.1.1 生成质量高
扩散模型通常能够生成细节较丰富、结构较自然的样本,特别是在图像任务中,视觉质量往往优于许多传统生成方法。
8.1.2 训练较稳定
与对抗式训练相比,扩散模型的优化目标通常更直接,较少出现训练失衡问题,因此更容易获得稳定结果。
8.1.3 条件控制灵活
由于可方便接入类别、文本、图像等条件信息,这类模型在可控生成和交互式编辑中应用广泛。
8.2 主要局限
尽管效果突出,扩散模型在效率和一致性方面仍存在明显挑战。
8.2.1 采样速度较慢
多步去噪带来较长的生成时间,使得实时应用受到一定限制。即使有加速方法,速度瓶颈仍较明显。
8.2.2 计算成本较高
训练与推断通常需要较多算力和内存资源,尤其在高分辨率和大规模条件生成任务中更为突出。
8.2.3 长程一致性挑战
在长视频、复杂布局或多对象交互任务中,模型有时难以保持全局一致性,容易出现细节漂移或结构偏差。
8.3 适用场景比较
扩散模型并非适用于所有生成任务,但在若干场景中优势明显。
8.3.1 大规模离线生成
当任务对速度要求不高、但对质量要求较高时,扩散模型十分适合批量离线生成,例如素材制作和内容创作。
8.3.2 精细编辑任务
在需要保留原始内容并进行局部改动的场景中,扩散模型常比一次性生成方法更具灵活性。
9 发展历程
9.1 理论萌芽
扩散模型并非凭空出现,而是建立在长期发展的随机过程与去噪建模思想之上。
9.1.1 随机扩散思想
随机扩散思想最初来自物理与概率论中的扩散现象描述,后逐渐被引入生成建模,用以解释样本如何从有序结构过渡到噪声状态。
9.1.2 去噪建模发展
去噪方法长期用于信号处理与表示学习。随着深度学习的发展,去噪思想被进一步系统化,最终成为现代扩散模型的重要基础。
9.2 现代扩散模型形成
现代扩散模型的形成标志着这一思想从理论框架走向可扩展的生成技术。
9.2.1 经典框架提出
经典框架的提出使扩散模型具备了清晰的训练目标、采样流程和数学表达,推动其在图像生成领域迅速发展。
9.2.2 生成性能提升
随着网络结构、条件控制和采样策略不断改进,扩散模型的图像质量与可控性持续提升,并逐步扩展到更多模态。
9.3 近期进展
近年来,扩散模型在效率、多模态与大规模生成方面快速演化。
9.3.1 高效采样研究
高效采样研究重点解决生成步骤过多的问题,包括减少迭代次数、改进求解器和优化指导方式等。
9.3.2 多模态扩展
多模态扩展使扩散模型能够处理文本、图像、音频和视频之间的转换与联合建模,增强了通用生成能力。
9.3.3 大规模条件生成
大规模条件生成结合海量数据与大模型架构,使扩散模型在复杂提示理解和高保真输出上继续进步。
10 评估方法
10.1 视觉质量指标
评估扩散模型时,常使用定量指标衡量生成样本的视觉逼真度和分布接近程度。
10.1.1 FID
FID用于比较生成样本与真实样本在特征空间中的分布距离。数值越低,通常表示生成结果越接近真实分布。
10.1.2 IS
IS主要衡量生成样本的类别可辨识度与多样性。它常被用于生成模型的横向比较,但并不总能全面反映感知质量。
10.2 一致性与多样性
除了清晰度,生成模型还需要兼顾样本多样性和整体一致性。
10.2.1 覆盖率
覆盖率描述生成结果对真实数据分布的覆盖程度。较高覆盖率通常意味着模型较少遗漏数据中的主要模式。
10.2.2 多样性分数
多样性分数用于衡量生成样本之间的差异程度。过低可能意味着输出重复,过高则可能说明稳定性不足。
10.3 下游任务评估
对于条件生成和编辑任务,单纯的视觉指标往往不够,还需要结合具体应用场景进行评价。
10.3.1 编辑效果评估
编辑效果评估关注模型是否准确完成修改,同时保持未编辑区域不受破坏。常通过人工观察或特定任务指标进行判断。
10.3.2 条件符合度评估
条件符合度评估检验生成结果与输入条件的一致程度,例如文本描述匹配度、类别准确率或结构约束满足度。
11 相关概念
11.1 噪声模型
噪声模型是指对随机扰动及其统计特征的描述,在扩散模型中用于定义加噪与去噪的基础形式。
11.2 得分函数
得分函数是概率密度对输入变量的梯度,反映样本向高概率区域移动的方向,是score-based方法的重要概念。
11.3 逆问题
逆问题是指根据观测结果恢复原始信号或隐含状态的任务,扩散模型在图像恢复、重建和编辑中常用于处理这类问题。
11.4 生成式人工智能
生成式人工智能是指能够根据数据学习并输出新内容的人工智能系统。扩散模型是其中的重要技术路线之一。