1 概念与定义
1.1 基本定义
Score-based模型是一类生成式概率建模方法,其核心是在数据空间中学习样本分布的得分函数,也就是对数概率密度关于输入变量的梯度。直观地说,模型不直接学习“如何生成”每个样本,而是学习“朝哪个方向移动,能更接近真实数据分布”。
在实际应用中,这类模型通常先从简单的随机噪声出发,再通过一系列逐步修正或反向演化过程,最终得到与训练数据相似的样本。因此,它们常被归入以“先加噪、再去噪”为特征的一类生成模型。
1.2 术语来源
“Score”一词在统计学中通常指对数密度函数的梯度,用来刻画分布在某一点附近的局部变化趋势。Score-based模型由此得名,强调学习的不是显式概率值本身,而是其局部导数信息。
这一术语在机器学习语境中逐渐固定下来,并与“score matching”“denoising score matching”等训练方法形成稳定关联。随着扩散式生成方法的发展,“score”也成为相关模型家族的重要关键词。
1.3 与生成建模的关系
与传统生成模型相比,Score-based模型更关注样本分布的局部结构。它通过学习梯度场来指导采样,使随机噪声逐步向高密度区域移动,从而完成生成。
这类方法与自回归模型、变分自编码器、生成对抗网络等都属于生成建模范畴,但实现机制不同。前者偏重显式概率分解,后者偏重对抗训练,而Score-based模型则依赖于噪声扰动下的梯度恢复过程。
1.4 与密度估计的联系
Score-based模型本质上服务于密度估计问题,但其估计对象并非直接的密度值,而是密度函数的梯度。由于归一化常数在高维数据中往往难以精确求取,这种间接方式具有现实优势。
通过学习score,模型能够在不显式写出完整概率密度的情况下,近似还原数据分布的形状。这使其在高维连续变量建模中尤其有吸引力。
2 理论基础
2.1 得分函数
2.1.1 数学定义
若数据变量记为 \(x\),其概率密度为 \(p(x)\),则得分函数定义为 \(\nabla_x \log p(x)\)。该向量描述了在样本点附近,增加或减小各个维度时,对数密度如何变化。
在经验上,得分函数可以看作“指向更可能区域”的方向场。模型训练的目标,就是让网络输出尽量接近真实分布对应的这一梯度。
2.1.2 几何直观
从几何角度看,得分函数为数据空间中的每个位置赋予一个方向。位于高密度区域附近时,梯度会趋于平缓;而处在低密度区域时,向高密度中心移动的趋势更明显。
这种直观解释帮助理解采样过程:随机点并不是一次性被“生成”,而是在得分场的引导下不断漂移、修正,最终贴近数据流形。
2.2 噪声扰动与去噪
Score-based方法常通过人为加入噪声来构造训练任务。由于原始数据可能分布复杂,直接学习其梯度较难;而当数据被轻微扰动后,分布会变得更平滑,便于估计。
训练时,模型学习在不同噪声水平下恢复扰动前的结构。这种“先破坏、后修复”的机制构成了去噪思想的核心,也为后续采样提供了逆向路径。
2.3 能量模型视角
2.3.1 归一化常数问题
许多概率模型可写为能量形式,即 \(p(x)\propto e^{-E(x)}\)。但其中的归一化常数通常难以计算,尤其在高维情形下更是如此。
Score-based方法避开了直接估计该常数的难点,因为对数密度求梯度时,常数项会自动消失。因此,它在能量模型学习中具有较高的实用价值。
2.3.2 梯度匹配思想
在能量模型视角下,训练目标可以理解为让模型学到的梯度场与真实分布的梯度场相一致。只要局部方向正确,采样时就能逐步向数据高密度区域靠拢。
这种梯度匹配思想与score matching高度相关,也构成了许多后续变体的理论基础。
2.4 与随机过程的关联
Score-based模型与随机过程联系紧密,尤其体现在扩散、布朗运动和随机微分方程等框架中。数据分布可以视为在噪声演化下不断“扩散”的结果,而生成过程则对应于这一过程的反向恢复。
这种观点把生成任务转化为随机动力系统中的逆问题,使采样、平滑和去噪都能在统一框架下讨论。
3 模型形式
3.1 基于噪声条件化的Score网络
常见做法是将噪声水平作为额外输入,构建一个条件化的神经网络。网络不仅接收数据样本,还接收对应的噪声强度,从而学习不同扰动尺度下的得分函数。
这种设计能让同一个模型覆盖多个噪声阶段,提高泛化能力,也方便在采样时逐级恢复样本。
3.2 多尺度Score模型
多尺度模型将不同噪声等级划分为若干层级,并分别学习各层对应的score。低噪声层更关注细节,高噪声层则负责整体结构与全局轮廓。
这种分层策略通常有助于稳定训练,并改善复杂数据上的生成效果。它也为后续的逐步采样提供了天然的时间顺序。
3.3 连续时间Score模型
3.3.1 随机微分方程形式
连续时间Score模型将噪声演化表示为随机微分方程。数据在前向过程中逐渐被扰动成简单噪声,而模型学习的是这一过程对应的反向梯度信息。
该形式具有较强的数学统一性,便于分析不同噪声调度和采样路径。
3.3.2 反向时间动力学
在连续框架下,生成过程可理解为前向随机扩散的反向时间动力学。借助学习到的score,系统可以从终态噪声开始,逆向回到数据分布附近。
这一定义不仅解释了采样机制,也使模型与物理中的时间反演现象形成类比。
3.4 离散时间Score模型
离散时间模型将连续扰动过程切分为有限步,分别处理每个时刻或噪声层级。每一步的目标通常是估计当前扰动水平下的得分方向。
这种形式实现简单,便于与现有深度学习框架结合。尽管在理论上不如连续模型统一,但在工程实践中依然很常见。
4 训练方法
4.1 去噪得分匹配
4.1.1 标准目标函数
去噪得分匹配通常要求模型在给定噪声扰动后的输入上,预测恢复原始数据分布所需的梯度信息。其目标函数一般通过最小化预测score与真实score之间的差异构造。
这一方法的关键优势在于,它不需要直接获得真实分布的显式表达,而是通过人工加噪生成监督信号。
4.1.2 加权损失设计
由于不同噪声水平下任务难度不同,训练时常对损失进行加权。较大噪声对应的样本可能更偏向全局结构,较小噪声则更强调局部细节。
合理的权重设计有助于平衡各阶段学习,避免模型过度偏向某一类噪声区间。
4.2 多噪声级别训练
多噪声级别训练通过随机抽取不同扰动强度,迫使模型同时适应多个分辨率层次。这种方式增强了模型对复杂分布的适配能力。
在实践中,它还能提升采样的连续性,使从噪声到样本的过渡更平滑。
4.3 自监督式学习机制
Score-based训练通常不依赖人工标注,而是利用原始数据自身构造监督信号,因此带有明显的自监督特征。模型通过预测噪声后的恢复方向来学习分布结构。
这种方式特别适合大规模无标签数据,降低了训练数据准备成本。
4.4 参数化选择
4.4.1 网络架构
常用的参数化方式包括卷积网络、U形网络以及适配连续时间建模的残差结构。对于图像数据,具备多尺度特征提取能力的架构尤其常见。
网络设计通常要兼顾表达能力与稳定性,因为score需要在不同噪声层级上保持一致性。
4.4.2 输出形式
模型输出可以直接表示score,也可以表示噪声、残差或其他等价量。不同参数化方式在数值稳定性和训练便利性上各有差异。
在实现中,输出形式的选择往往会影响采样公式的构造方式,因此属于核心设计之一。
5 采样与生成
5.1 逐步反向采样
Score-based模型生成样本时,通常从高斯噪声或其他简单分布出发,再依据学习到的score逐步修正。每一步只做小幅更新,因此过程看上去像一场缓慢的“去雾”。
这种渐进式生成方式有利于获得细节丰富的结果,但也意味着整体采样过程可能较长。
5.2 Langevin动力学采样
5.2.1 迭代更新规则
Langevin动力学是一种经典采样方法,结合了梯度上升和随机噪声注入。对于Score-based模型而言,可借助估计到的score,引导样本向高概率区域移动。
在每次迭代中,样本会沿score方向更新,并叠加一定随机扰动,以保持对目标分布的探索性。
5.2.2 步长与收敛性
步长大小直接影响采样质量与稳定性。步长过大容易导致震荡或偏离目标分布,步长过小则会增加采样时间。
收敛性通常取决于模型质量、噪声设计以及迭代策略,因而需要在速度与精度之间取得平衡。
5.3 扩散反演过程
扩散反演过程指从完全噪声状态反向恢复到数据样本的全过程。前向扩散负责逐步破坏数据结构,反向过程则在score引导下逆转这一演化。
这一机制是扩散式生成与Score-based方法之间最紧密的联系之一,也是在工程上最常见的采样范式。
5.4 采样加速技术
为降低生成时间,研究者提出了多种加速思路,例如减少迭代步数、采用更高阶数值求解器、蒸馏采样轨迹等。此类方法的目标是在尽量不损失质量的前提下缩短推理成本。
加速技术通常需要与稳定性控制同时考虑,否则可能出现细节缺失或样本偏移。
6 典型变体
6.1 Score Matching模型
Score Matching模型强调直接匹配模型score与数据score。它是Score-based方法的重要理论起点,为后来的噪声条件化训练提供了基础。
该类模型的优点在于概念清晰,但在高维复杂分布下,单纯的原始score matching往往难以直接应用,因此常与去噪机制结合。
6.2 Noise Conditional Score Network
Noise Conditional Score Network,简称NCSN,是将噪声水平作为条件输入的代表性模型之一。它通过多噪声层级学习score,从而支持从噪声到样本的分层生成。
这一框架在早期推动了Score-based生成模型的发展,也为后续扩散模型提供了重要思路。
6.3 扩散概率模型
扩散概率模型与Score-based方法高度相近,二者都依赖前向加噪和反向去噪的思想。差别更多体现在参数化、训练形式和采样表述上。
在很多讨论中,扩散概率模型可被视为Score-based框架的一个具体实现方向,二者常被并列分析。
6.4 基于SDE的Score模型
6.4.1 变量噪声调度
基于SDE的模型通常引入随时间变化的噪声强度,以控制扩散速度和生成难度。不同的噪声调度会影响样本平滑程度以及反向采样的数值稳定性。
这种设计使模型能够适配不同数据类型,并在理论上形成连续统一的描述。
6.4.2 概率流ODE
概率流ODE是与随机扩散相对应的确定性形式。它在保持边缘分布一致的前提下,用常微分方程替代随机过程描述采样路径。
由于去除了随机项,这一形式有时更便于分析,也可能在某些场景下简化推理流程。
7 应用领域
7.1 图像生成
在图像生成任务中,Score-based模型能够合成高分辨率、细节丰富的视觉内容。其逐步去噪机制尤其适合处理纹理、边缘和复杂结构。
这类方法在自然图像、艺术图像和医学影像合成中都有较强表现。
7.2 图像修复与补全
当图像存在缺失区域、遮挡或损坏时,Score-based模型可借助整体分布信息进行推断补全。它不仅考虑局部像素,还会结合全局上下文生成更协调的结果。
因此,这类模型常用于去噪、修复裂痕、填补空洞等任务。
7.3 超分辨率重建
在超分辨率重建中,模型需要从低分辨率输入恢复高分辨率细节。Score-based方法能够通过概率建模方式生成更自然的纹理与边界。
相比简单插值方法,它更擅长补足高频信息,但同时对采样质量较为敏感。
7.4 音频与语音合成
Score-based思想同样适用于波形音频和语音生成。由于音频信号具有连续值和复杂时序结构,score建模能够较好地刻画其分布变化。
在语音合成中,它有助于生成更平滑、自然的声学输出,并减少部分传统方法中的机械感。
7.5 科学数据建模
Score-based模型在科学计算中具有较强潜力,尤其适用于连续变量、复杂约束和高维分布的场景。它可作为数据驱动的生成工具,辅助探索难以解析建模的问题。
7.5.1 分子结构生成
在分子结构生成中,模型需要同时考虑几何结构与化学合理性。Score-based方法可用于生成候选构型,并帮助探索满足约束条件的分子空间。
这类应用常与结构优化、属性预测等任务结合。
7.5.2 蛋白质与材料模拟
在蛋白质和材料模拟中,模型可用于生成符合统计规律的结构样本,或辅助近似复杂势能面上的分布。其优势在于能够处理高维连续空间中的结构依赖关系。
不过,这类任务通常对物理一致性要求较高,因此往往需要额外的约束机制配合。
8 性能评估
8.1 生成质量指标
生成质量通常通过视觉效果、似然估计近似值或专门的评价指标来衡量。对于图像任务,常见关注点包括清晰度、细节保真度和伪影控制。
由于Score-based模型偏概率化建模,其质量评估往往需要结合主观与客观标准。
8.2 多样性与覆盖度
除质量外,模型还需要尽可能覆盖真实数据的多个模式。若样本过于单一,则可能出现模式坍缩或分布偏差。
多样性与覆盖度用于衡量生成集合是否具有足够的变化范围,以及是否遗漏了重要的数据区域。
8.3 采样速度评估
采样速度是Score-based模型的重要工程指标。由于其生成过程通常分多步完成,实际推理时间可能明显高于一次性输出的模型。
因此,评估时常关注单样本耗时、迭代次数以及在不同加速策略下的性能变化。
8.4 稳定性与鲁棒性
稳定性主要考察训练是否容易发散、采样是否对参数敏感,以及面对噪声或输入扰动时是否仍能保持合理输出。鲁棒性则强调在不同数据集、噪声尺度和初始化条件下的表现一致性。
这些指标对于实际部署尤为重要,因为生成模型往往要在多样环境中运行。
9 优势与局限
9.1 优势
9.1.1 理论可解释性
Score-based模型具有较强的数学基础,其训练目标、采样过程和随机动力学关系都较清晰。相比某些纯经验式生成方法,它更便于分析和推导。
这种可解释性使其在研究领域受到持续关注。
9.1.2 高质量生成能力
在多类任务上,Score-based模型都能生成细节丰富、分布逼真的样本。尤其在复杂连续数据上,它往往能体现出较强的表现力。
这也是其在图像和科学建模中逐渐普及的重要原因。
9.2 局限
9.2.1 采样成本较高
由于通常需要多轮迭代,生成速度相对较慢。对于大规模实时应用,这一点可能成为明显瓶颈。
尽管已有不少加速手段,但完全兼顾质量与速度仍不容易。
9.2.2 训练与调参复杂
噪声调度、损失权重、网络结构和采样策略都会影响最终结果。模型开发者往往需要投入较多经验来选择合适配置。
因此,其工程门槛通常高于一些更直接的生成框架。
9.2.3 高维空间中的稳定性问题
在高维空间内,score估计更容易受到数据稀疏性和数值误差影响。若训练不充分,采样轨迹可能偏离真实分布,或出现局部不稳定现象。
这也是研究中持续优化的重要方向。
10 研究进展
10.1 早期理论奠基
Score-based方法的理论基础来自统计学中的score matching与能量建模思想。早期工作主要解决如何在不显式计算归一化常数的情况下学习分布梯度。
这些研究为后续的噪声条件化与去噪框架奠定了基础。
10.2 与扩散模型的融合
随着扩散概率模型的发展,Score-based思想与扩散生成框架逐渐深度融合。两者在训练与采样上的对应关系被进一步明确,也推动了统一表述的形成。
这种融合使模型家族更完整,并增强了其在多模态生成中的适用性。
10.3 采样效率改进
近年来,研究重点之一是缩短生成时间。相关工作包括更少步数的采样器、更高效的数值求解、以及将多步生成过程压缩为更短轨迹的方法。
这些改进显著提升了模型的实用性,也使其更接近真实应用需求。
10.4 统一生成框架的发展
当前研究正朝着更统一的概率生成框架推进,希望将score建模、扩散过程、ODE/SDE采样及其他生成方式纳入同一理论视角。这样不仅便于比较不同方法,也有助于发现新的算法连接点。
在这一趋势下,Score-based模型不再只是单独的一类方法,而逐渐成为现代生成建模体系中的关键组成部分。