概述
多元正态分布(multivariate normal distribution)是刻画多个随机变量共同波动的一类概率模型。设随机向量 \(X\) 的任意线性组合都服从一元正态分布,则称 \(X\) 服从多元正态分布。该分布由均值向量与协方差矩阵共同确定:前者控制分布的“中心位置”,后者刻画变量之间的相关性以及各方向上的离散程度。
多元正态分布之所以常见,是因为它在仿射变换下仍保持正态结构,并且边缘分布与条件分布同样属于正态族。这些性质使其成为统计推断、线性模型、贝叶斯分析、随机过程与机器学习中可直接调用的基础工具。
1 概念与定义
1.1 随机向量的正态性
令 \(X\in\mathbb{R}^d\) 为随机向量。称 \(X\) 为多元正态,若对任意向量 \(a\in\mathbb{R}^d\),标量随机变量 \(a^\top X\) 都服从一元正态分布。该刻画方式强调“投影保持正态”:从多维空间沿任意方向投影,都得到一元高斯形式。
当协方差矩阵存在时,上述线性组合条件与“特定参数化的概率密度形式”是等价的,从而可用均值与协方差描述整个分布。
1.2 位置参数:均值向量
多元正态分布的均值向量记为 \(\mu\in\mathbb{R}^d\)。它满足 \[ \mathbb{E}[X]=\mu. \] 几何直观上,\(\mu\) 是分布密集区域的“中心”。在等密度曲面上,\(\mu\) 相当于椭球的中心。
1.3 离散结构:协方差矩阵
协方差矩阵记为 \(\Sigma\in\mathbb{R}^{d\times d}\),其元素为 \[ \Sigma_{ij}=\operatorname{Cov}(X_i,X_j). \] 对角线元素给出各分量的方差,非对角线元素反映分量之间的线性相关强弱与方向性。通常要求 \(\Sigma\) 为对称半正定矩阵,以保证对应二次型与概率含义一致。
1.4 概率密度函数与参数形式
当 \(\Sigma\) 为正定矩阵(可逆)时,多元正态分布具有密度函数。记 \(X\sim \mathcal{N}(\mu,\Sigma)\),其密度为 \[
| f(x)=\frac{1}{(2\pi)^{d/2} | \Sigma | ^{1/2}} |
|---|
\exp\left(-\frac12 (x-\mu)^\top \Sigma^{-1}(x-\mu)\right). \]
| 其中 \( | \Sigma | \) 为行列式,\(\Sigma^{-1}\) 为逆矩阵。指数项是由二次型 \((x-\mu)^\top \Sigma^{-1}(x-\mu)\) 构成,体现了不同方向上的“尺度”差异。 |
|---|
2 几何与性质
2.1 等密度椭球的含义
密度只与二次型 \[ (x-\mu)^\top \Sigma^{-1}(x-\mu) \] 有关,因此等密度曲面由 \[ (x-\mu)^\top \Sigma^{-1}(x-\mu)=c \] 给出。该集合在几何上对应椭球面(或其退化形式),其主轴方向与 \(\Sigma\) 的特征结构相关。换言之,\(\Sigma\) 决定“椭球怎么拉伸”,而 \(\mu\) 决定“椭球在哪里”。
2.2 独立与不相关的关系
对正态向量,\(\Sigma\) 的非对角项为零会带来重要简化:若 \(X\) 为多元正态且协方差为零,则相应分量之间不仅不相关,而且彼此独立。更一般地,若把向量分量视为若干子向量,则在多元正态背景下,“不相关”与“独立”在恰当条件下等价。
因此,多元正态提供了一种把相关结构直接转化为独立性结论的路径,常用于建模与变量筛选。
2.3 对称性与旋转/线性变换
多元正态在数学上呈现出强对称性:若对随机向量做正交变换或更一般的线性变换,新的随机向量仍保持正态分布,只是均值与协方差相应改变。直观上,不同坐标系表达同一“椭球形状”,只是参数表示随之更新。
该性质使得许多推导可以在选定坐标系后简化,例如通过对协方差进行对角化来理解各主成分的独立性结构。
2.4 仿射不变性
若 \(X\sim \mathcal{N}(\mu,\Sigma)\),对仿射变换 \[ Y = A X + b \] (其中 \(A\) 为矩阵,\(b\) 为向量),则 \[ Y \sim \mathcal{N}(A\mu+b,\, A\Sigma A^\top). \] 仿射不变性是多元正态的重要特征:线性模型、误差传播以及许多工程系统中,状态与观测常通过线性或仿射关系连接,从而自然落入这一分布族。
3 分布的变体
3.1 边缘分布
多元正态的任意子向量(选取部分分量)仍服从多元正态,其均值与协方差可从原参数中相应抽取子块得到。边缘化不会破坏正态结构,因此在多维模型中可方便地关注某些变量,而忽略其余变量。
边缘分布的均值对应被选变量在 \(\mu\) 中的分量,协方差对应 \(\Sigma\) 中对应的子矩阵。
3.2 条件分布
对多元正态向量分量进行条件化后,条件分布依然是正态分布。具体而言,设将变量划分为两组并对其中一组取值条件,另一组的条件分布仍为正态,其均值是线性函数,协方差与条件值无关(只由原协方差结构决定)。
这一性质使得在推断中可以将“给定观测后的不确定性”保留为解析形式,便于计算后验或预测分布。
3.3 联合分布与分解关系
多元正态可以看作由均值与协方差共同构成的联合分布。联合分布与边缘、条件分布之间存在一致的分解关系:联合密度可通过条件密度与边缘密度相乘得到,且每一部分都仍保持正态形式。这种一致性使得模型组合与模块化推断更为可行。
在实践中,这也意味着不同模块(例如某些特征与某些隐变量)之间的关系可以通过协方差子块进行表达,而无需重新拟合全局分布的复杂形式。
3.4 退化情形与半正定协方差
| 当 \(\Sigma\) 仅为半正定(不一定可逆)时,密度可能无法以标准形式写成(因为 \( | \Sigma | =0\))。此时分布可以理解为在较低维子空间上的“退化高斯”。换言之,随机向量可能落在某些约束形成的平面或曲线附近,表现为方差在某些方向上为零。 |
|---|
在此情形下,边缘与条件分布仍可在合适的广义框架下讨论,并常通过广义逆或限制到有效子空间来实现计算。
4 参数化与计算
4.1 常见参数约定
多元正态常用记号 \(\mathcal{N}(\mu,\Sigma)\) 表示均值与协方差。不同学科还可能使用精度矩阵(逆协方差)作为参数,或使用协方差的分块形式以服务条件分布推导。
在算法实现层面,选择用 \(\Sigma\) 还是用其逆/精度,往往与数值稳定性、计算复杂度和是否需要条件化有关。
4.2 协方差分解(如 Cholesky)
为了高效计算与采样,通常需要将协方差分解为可操作的形式。若 \(\Sigma\) 正定,可进行 Cholesky 分解: \[ \Sigma = L L^\top, \] 其中 \(L\) 为下三角矩阵。该分解把“在各方向上的尺度与相关性”转化为一个线性映射的结构:从独立标准正态到相关正态,只需一次线性变换。
| 在计算对数似然、求解线性方程组或计算 \( | \Sigma | \) 时,分解也能显著提升数值表现。 |
|---|
4.3 采样方法(生成多元正态样本)
常见采样流程是:先生成 \(Z\sim \mathcal{N}(0,I)\) 的独立标准正态样本,再通过线性变换得到 \[ X = \mu + L Z, \] 其中 \(L\) 来自 \(\Sigma=L L^\top\) 的分解。这样得到的 \(X\) 即服从 \(\mathcal{N}(\mu,\Sigma)\)。
若 \(\Sigma\) 退化,可先对有效子空间做特征分解或数值低秩处理,再在相应维度采样并映射回原空间。
4.4 似然函数与估计目标
给定观测样本 \(\{x^{(n)}\}_{n=1}^N\),在参数已知协方差或均值未知的情形下,可以写出多元正态的对数似然。一般形式包含二次误差项与对协方差行列式的贡献。极大似然估计通常可得到闭式解,尤其在无约束且正定条件满足时,样本均值与样本协方差常作为估计目标。
在高维情形,直接估计协方差可能遇到不适定或过拟合,需要正则化或约束(例如收缩估计、低秩假设等),以提升可用性。
5 统计推断应用
5.1 均值向量的估计
在多元正态模型中,均值向量的估计与样本均值密切相关。若样本独立同分布且协方差已知,最大似然估计通常等于样本平均;若协方差也待估,则估计通常在联合优化下完成,但仍能保持与样本平均的紧密联系。
估计精度受样本量与协方差结构影响:当变量强相关或某些方向方差很小,估计的稳定性会随之变化。
5.2 协方差矩阵的估计
协方差矩阵的估计同样依赖样本二阶统计量。经典无偏或极大似然形式对应的系数不同,但都通过样本对均值的偏差外积构成估计量。
当协方差维度较高、样本不足时,估计可能不稳定或不可逆,导致后续条件分布或似然评估困难,此时常引入正则化、结构化协方差或降维策略。
5.3 线性模型中的角色
多元正态常作为误差项或随机系数的分布假设。例如线性回归的误差若服从正态,回归系数的后续推断与置信区间计算可用解析形式表达;在高斯噪声假设下,许多最小二乘相关方法与最大似然推断一致。
此外,若响应与特征之间通过线性映射连接,仿射不变性保证了整体仍可保持高斯结构,从而便于传播不确定性。
5.4 多元检验的典型框架
在多维情况下,常见检验会使用协方差结构构造统计量。例如当均值向量的偏离需要被检验时,可以在协方差尺度下度量偏差大小,从而形成类似马氏距离(Mahalanobis distance)的统计思想。配合样本估计的协方差,检验可以在多元正态假设下得到标准化的分布参考。
在实际应用中,检验框架通常依赖“正态性带来解析分布”这一核心便利,但也会在数据偏离正态假设时转向稳健方法。
6 贝叶斯与推断
6.1 共轭先验的基本思想(概览)
在贝叶斯框架中,共轭先验指:选取的先验与似然相结合后,后验分布仍属于同一参数化族。多元正态模型中,共轭结构常用于均值与协方差的联合或分层建模,使得后验能够保持解析形式或易于更新。
这类思想的价值在于:既保留概率解释,又能避免纯数值采样的计算负担(在可适用时)。
6.2 后验分布的结构
给定观测后,后验通常呈现“均值线性更新、协方差按不确定度合并”的效果。尤其在条件正态的情形下,更新可被理解为把先验的中心与观测信息在协方差度量下融合:协方差越小(信息越强),更新越倾向于某一侧。
这种结构使得预测分布(对未来观测的分布)仍为正态,从而在贝叶斯推断里实现了可直接使用的闭式或半闭式表达。
6.3 不确定性传播(概览)
当模型中存在多个高斯随机量通过线性或仿射关系连接时,多元正态的仿射不变性可以直接用于不确定性传播:输入的不确定性以协方差形式进入,输出的不确定性通过线性映射转换。对于许多工程与学习系统,这意味着无需复杂的数值近似就能得到输出分布的均值与协方差。
对于非线性情况,常见做法是局部线性化或使用采样近似,把问题重新带回可计算的高斯近似框架。
7 相关理论与扩展
7.1 高维情形的挑战与直觉
当维度 \(d\) 很大时,协方差矩阵估计与矩阵运算的难度显著增加,尤其当样本数 \(N\) 与维度同量级甚至更小。此时协方差可能病态或近似不可逆,导致条件分布与似然计算出现数值不稳定。
从直觉上看,高维空间中“距离度量”和“方向结构”变得更敏感:数据的有限样本可能无法可靠估计每个方向的方差与相关性,从而影响推断质量。
7.2 与椭圆分布/高斯族的联系(概览)
多元正态属于椭圆分布(elliptical distributions)与高斯族的核心成员:它具有由二次型驱动的等密度结构,呈椭球对称性。与高斯相比,某些椭圆分布族可拥有更厚尾或不同的集中程度,适用于更偏离正态的情形。
在扩展模型中,人们常通过改变“径向衰减方式”来调节尾部行为,同时仍保留一定的几何对称特征。
7.3 多元正态在随机过程中的出现(概览)
在随机过程里,多元正态常以有限维边缘分布的形式出现,例如高斯过程(Gaussian process)的任意有限采样点通常服从多元正态。此时过程可被理解为“在所有输入点上的联合高斯结构”的推广。
因此,多元正态不仅是静态向量的模型,也在时序或函数型建模中充当基础构件。
7.4 与生成模型中的“高斯假设”(概览)
在生成建模中,常见的做法是对潜变量或中间表征引入高斯假设,以便利用解析性质或实现高效训练。无论是以高斯噪声为观测模型,还是以高斯先验约束潜变量,多元正态带来的可计算性与可解释性都具有吸引力。
在实际应用中,“高斯假设”有时也被视为简化:当数据分布明显偏离高斯时,模型可能通过非线性变换或更复杂的分布族来弥补。