1 变分推断概览

1.1 目标:近似复杂后验

变分推断(Variational Inference, VI)解决的问题通常是:在给定观测数据后,贝叶斯模型后验分布往往无法用闭式形式表示或难以高效计算。VI通过引入近似分布,将“真实后验的计算”转化为“近似分布的选择与优化”。

1.2 核心思想:用可优化问题替代难积分

贝叶斯推断中,后验分布的关键在于归一化常数与难积分。VI不直接计算后验,而是从某个可计算的近似族出发,构造近似分布,并通过优化目标函数让近似分布尽量贴近真实后验。最常见的目标是证据下界(ELBO),其性质使得优化过程在数学上更容易落地。

1.3 与 MCMC 的基本对比(速度可扩展性、误差)

马尔可夫链蒙特卡洛(MCMC)相比,VI一般不需要在高维空间中进行长时间采样来逼近后验,因此通常具有更好的计算效率与可扩展性,尤其适合大规模数据或需要频繁更新后验的场景。与此同时,VI依赖于近似族的表达能力,可能产生系统性偏差;而MCMC在理论上可通过增加采样量逐步接近真实后验,但计算成本更高。两者常见的差异可概括为“VI更快但受限于近似假设,MCMC更通用但更昂贵”。

2 贝叶斯推断基础

2.1 后验分布与贝叶斯公式

随机变量为 \(z\),观测为 \(x\)。在贝叶斯框架下,后验分布可表示为 \[ p(z\mid x)=\frac{p(x,z)}{p(x)}, \] 其中 \(p(x,z)\) 为联合分布,\(p(x)\) 为边缘似然(证据)。当 \(p(x)\) 或相关积分难以计算时,直接求后验会变得困难。

2.2 证据(Evidence)与对数证据

证据 \(p(x)\) 是对联合分布在潜变量上的边缘化结果。对数证据 \(\log p(x)\) 在学习与模型比较中具有重要意义,因为它与模型解释数据的能力相关。但在许多模型中,\(\log p(x)\) 仍然需要难以计算的积分或求和,因此VI常通过构造下界来规避该问题。

2.3 KL散度与距离度量直觉

变分推断的目标通常与 Kullback–Leibler 散度(KL散度)相关。对任意近似分布 \(q(z)\),KL散度 \[

\mathrm{KL}(q(z)\|p(z\mid x))

\] 衡量 \(q\) 与真实后验的“不相似”。KL散度不对称,因此它反映了“优化 \(q\) 来逼近 \(p\)”时可能出现的偏好方向与覆盖方式差异。VI利用这些性质,将复杂的后验逼近转为更易优化的准则。

3 变分推断的数学框架

3.1 近似分布族(Variational Family)

VI首先选定一个可计算的近似族 \(\mathcal{Q}\),并在其中寻找最优近似分布 \(q(z)\)。该族的选择决定了VI的表达能力与计算复杂度:近似族越灵活,通常越能贴近真实后验,但优化可能更难;近似族越简单,算法更快,但更容易引入偏差。

3.2 证据下界(ELBO)

ELBO(Evidence Lower Bound)是对 \(\log p(x)\) 的一个下界。其形式常见为 \[ \mathcal{L}(q)=\mathbb{E}_{q(z)}[\log p(x,z)]-\mathbb{E}_{q(z)}[\log q(z)]. \] 通过构造该下界,可以在不直接计算 \(\log p(x)\) 的情况下,仍然得到可优化的目标。ELBO越大,意味着在该近似族内对证据的下界更紧,从而近似质量更高(与真实后验的距离通常也更小)。

3.3 优化视角:最大化 ELBO / 最小化 KL

在合适的条件下,最大化 ELBO 等价于最小化从 \(q(z)\) 到真实后验的 KL散度。换句话说,VI的核心优化问题可被理解为:在近似族中找一个分布,使其在信息论意义下尽可能接近真实后验,同时又避免难算的归一化常数。

3.4 反向推导与等价形式(常见表述)

在实践中,ELBO与KL之间往往可以用多种等价形式表述,例如将目标写成期望、熵项与交叉熵的组合,或通过代数变形把不易计算的项剔除。不同表述对应不同的实现方式:有的形式更适合解析更新,有的形式更适合梯度优化;但它们本质上围绕同一个“下界-距离”关系展开

4 典型近似策略

4.1 均值场假设(Mean-Field VI)

均值场假设是最常用的VI近似策略之一。它假设潜变量之间相互独立(在近似后验意义下),即 \[ q(z)=\prod_i q_i(z_i). \] 这种结构显著简化计算,因为可以将联合优化拆解为若干子分布的更新。代价是它会削弱变量间的相关性建模能力,可能导致后验依赖信息丢失。

4.2 协方差结构与更灵活的近似

为改善均值场带来的限制,近似族可以改用更丰富的相关结构,例如对潜变量使用具有协方差的高斯近似、使用分层或块结构的因子分解,或者采用更通用的参数化分布。此类方法通常能更好捕捉后验的耦合关系,但计算与优化开销也随之增加。

4.3 精度-效率权衡:近似族容量选择

近似族容量指其表达能力与参数规模的综合。选择过窄的近似族会造成系统性偏差(近似“装不下”真实后验的形状);选择过宽则可能带来更难的优化、更高的过拟合风险或更复杂的数值稳定需求。因此,容量选择常通过任务需求、数据规模、可接受的计算预算与经验调参来平衡。

4.4 收敛性局部最优问题(一般性讨论)

VI通常通过迭代优化实现,目标函数可能是非凸的,因此收敛到全局最优并无保证。一般而言,算法会在某种程度上稳定到局部最优或鞍点附近。工程上常通过多次初始化、合适的学习率与正则策略改善结果的可靠性;在理论层面,通常讨论的是单步更新的下降性质或在特定条件下的收敛保证。

5 推断算法与实现

5.1 坐标上升/坐标下降(Coordinate Ascent)

当近似族与模型结构允许时,可以使用坐标上升(或下降)进行更新:一次只更新某一部分变分参数,其他保持不变,从而使目标(如ELBO)单调改善。对于一些共轭模型,坐标更新可以获得解析形式,效率高且实现相对直接。

5.2 梯度型变分推断(Gradient-Based VI)

对更一般的近似族或非共轭模型,常用梯度方法直接最大化 ELBO。做法是对变分参数求梯度并迭代更新。与解析更新相比,这类方法更通用,但需要选择优化器与超参数(学习率、动量等),并对梯度估计的方差与数值稳定性保持关注。

5.3 重参数化技巧(Reparameterization Trick)

在梯度型VI中,如何对期望项进行可微分的估计是关键。重参数化技巧通过把随机采样表示为“确定性变换 + 基础噪声”,从而将梯度传递到变分参数上。其优势通常体现在梯度方差更可控、优化更稳定。具体实现取决于所选近似分布是否能进行合适的重参数化。

5.4 采样与小批量优化(Stochastic VI)

当数据量很大时,ELBO可分解为对数据项的求和。为了降低计算成本,可以使用小批量(mini-batch)估计目标或其梯度,从而得到随机变分推断(Stochastic VI)。这种方法显著加快迭代速度,但梯度噪声会带来震荡,需要配合学习率调度、批量大小与方差控制手段。

5.5 监控指标:ELBO 与近似质量评估

训练过程中常以ELBO作为主监控指标:ELBO上升(或下降量减小)通常意味着近似在该框架下变得更好。但ELBO本身是下界,数值变化并不总能完全反映“与真实后验的差距”。在可行时,可以通过后验预测、合成数据验证或对少量实例的更精确推断来评估近似质量;同时观察参数的异常行为(如方差塌缩)也有助于诊断问题。

6 变分推断的常见应用

6.1 主题模型中的变分推断(如 LDA 思路)

在主题模型中,潜变量常代表文档到主题的分配。VI可通过构造对主题分配与词分布相关潜变量的近似后验来进行推断。均值场或块结构的因子分解能够让每个文档或每个主题的更新相对独立,从而实现大规模数据上的有效训练。实际中,VI常用来加速传统推断方式,使主题学习能够更快迭代。

6.2 变分自编码器(VAE)中的后验近似

VAE将生成模型与深度学习结合:编码器网络输出近似后验 \(q(z\mid x)\) 的参数,解码器生成数据。VI在该框架下常以ELBO为训练目标:一部分对应重建或似然项,另一部分对应KL正则项,用以约束潜变量分布不过度偏离先验。该设计使得模型既能学习潜空间结构,又能保持可训练性。

6.3 混合模型与层级贝叶斯的近似推断

在混合模型中,VI可用于估计成分指派或潜变量的后验近似;在层级贝叶斯中,还可对超参数或多层潜变量进行近似更新。由于层级结构可能导致后验复杂,VI通过分解期望与使用合适的近似族,能够在可接受的计算预算内完成推断。此类应用往往强调工程实现的稳定性与模型结构的可扩展性。

6.4 高斯过程与结构化近似(概念性)

高斯过程(GP)在回归与分类中广泛使用,但其后验在数据量较大时会变得昂贵。VI可以通过诱导变量、稀疏近似或结构化变分族来降低计算复杂度,从而实现更快的训练与预测。概念上,这类方法用更少的“代表性自由度”来近似真实后验的关键结构,提升可扩展性。

7 实践要点与常见坑

7.1 近似族选得太“窄”导致偏差

如果近似族结构过于简化(例如强制独立且缺乏相关性),模型可能无法表达真实后验的形状与多模态特征,导致预测偏差。此时即使ELBO看起来上升,也可能对应的是“在受限表达下的次优贴合”,结果表现可能不理想。

7.2 KL 方向差异带来的“模式覆盖”问题

KL散度的方向会影响优化的偏好。例如使用 \(\mathrm{KL}(q\|p)\) 时,优化可能倾向于覆盖 \(q\) 的高概率区域并避免把概率质量放在低似然区域;对多模态后验,这可能导致“只覆盖一个模态”的现象。理解KL方向及其对模式覆盖的影响,有助于选择更合适的近似族或目标函数变体。

7.3 数值稳定性与实现细节

实际实现中常见问题包括对数运算的下溢/上溢、方差参数的约束、以及在计算ELBO组件时的采样方差过大。通常需要采用对数域稳定技巧、对方差或尺度参数进行合适的参数化(如使用对数尺度)以及合理的梯度裁剪或方差控制策略。

7.4 超参数与初始化对结果的影响

VI优化对初始化与超参数较敏感:学习率过大可能导致发散或震荡,过小则收敛缓慢;初始化不当可能把优化锁在不理想的局部区域。工程上常通过网格搜索、学习率调度、使用更稳健的参数初始值和多次重启来提高可复现性。

7.5 何时优先考虑 VI 而非 MCMC

当需要快速迭代、数据规模较大、或在训练过程中频繁进行后验更新时,VI通常更合适。若模型结构复杂导致MCMC难以高效采样,VI通过可计算近似族与梯度优化提供了实用的替代方案。反之,如果近似误差特别敏感,且计算资源允许,可能需要考虑MCMC或混合策略来验证结果的可靠性。

8 相关方法与扩展

8.1 自然梯度变分推断(概念性)

自然梯度方法通过引入参数空间的度量结构,使得更新方向在信息几何意义下更合理。直观上,它能缓解普通梯度在不同尺度下的“效率不均”,在某些VI任务中提高收敛速度与稳定性。其具体实现依赖于Fisher信息矩阵或其近似形式。

8.2 扰动-增强与更强的近似族思路

当近似族过于简单导致偏差时,可以考虑对近似分布施加增强机制,例如引入更灵活的变换或扩展近似结构。扰动增强等思想旨在让近似族更贴近真实后验的几何形状,同时保持一定的可优化性。它们通常在“表达能力”和“优化难度”之间寻找折中。

8.3 结合采样的混合策略(概念性)

有些扩展方法会把VI与采样结合,例如用VI提供初始近似,再通过局部或少量采样进行校正,或使用带有采样成分的目标函数。此类混合策略希望兼顾VI的速度与更高精度的后处理,从而提升整体鲁棒性。是否值得使用取决于计算预算与对精度的需求。

8.4 跨领域变分法:从统计到深度学习

变分推断不仅存在于传统统计建模,也在深度学习中演化出大量实用变体。随着神经网络提供了更强的函数逼近能力,变分族可以更灵活;同时自动微分与GPU加速让梯度型VI成为常见选择。这种跨领域融合使得VI既能保留贝叶斯推断的思想框架,也能利用现代计算工具快速落地。

9 术语与符号速查(供新手对照)

9.1 关键符号:p、q、KL、ELBO

  • \(p(\cdot)\):真实生成模型相关分布(如先验、联合分布、后验、证据)。
  • \(q(\cdot)\):变分近似分布,用于近似真实后验。
- \(\mathrm{KL}(q\|p)\):KL散度,衡量近似与目标分布差异。
  • ELBO:证据下界,作为VI优化目标。

9.2 常用目标函数整理

VI的常见目标包括:

  1. 最大化ELBO:直接优化可计算下界。
  2. 最小化KL散度:在等价关系下把逼近问题转为距离最小化。
  3. 将目标拆成期望与熵/交叉熵项:便于实现与数值计算。

9.3 读公式的“从生成模型到目标”的路线图

阅读VI相关公式时可以按如下路径组织理解:

  1. 先从生成模型写出 \(p(x,z)\) 与目标后验 \(p(z\mid x)\)。
  2. 再引入近似分布 \(q(z)\) 替代不可算的后验。
  3. 通过代数变形构造ELBO,把难算项转为下界形式。
  4. 最终得到可优化的目标,并据此选择更新算法(解析或梯度、批量或小批量)。