1 基本定义
高斯过程是一类以函数为对象的随机模型,用于描述输入空间中各点取值之间的联合不确定性。与只对单个随机变量建模不同,它直接刻画“整条函数曲线”的可能形态,因此常被视为函数空间中的概率分布。
在直观上,高斯过程可以理解为无限维的高斯分布:当选取有限个输入点时,对应函数值构成一个多元高斯随机向量;而当输入点集合扩展时,这种高斯结构仍然保持一致。
1.1 随机过程的基础
随机过程是以时间、空间或其他索引变量为自变量的一族随机变量。每个索引值对应一个随机变量,而这些随机变量共同组成一个随机函数。随机过程的研究重点,是分析不同索引处取值之间的相关关系,以及整体演化规律。
在数学上,随机过程通常记为 \(\{X(t), t\in T\}\),其中 \(T\) 是索引集合。若 \(T\) 表示时间,则可用于描述动态系统;若 \(T\) 表示空间位置,则常见于地理统计、图像建模等场景。
1.2 高斯过程的定义
高斯过程是一类特殊的随机过程。若任意有限个输入点对应的随机变量联合起来都服从多元高斯分布,则该随机过程称为高斯过程。它由均值函数和协方差函数完全确定,前者描述中心趋势,后者描述相关结构。
高斯过程具有较强的表达能力:既能表示光滑变化的函数,也能通过不同核函数体现周期性、局部性或非平稳特征,因此在建模中非常灵活。
1.2.1 有限维分布的高斯性
高斯过程的关键特征在于有限维分布的高斯性。也就是说,从该过程中任意抽取有限个点,其函数值向量都满足多元高斯分布的形式。这一性质保证了局部观测与整体模型之间的数学一致性。
由于多元高斯分布只需均值向量和协方差矩阵即可描述,因此高斯过程也可通过对应的均值函数与协方差函数进行完整表征。
1.2.2 任意输入点集合上的联合分布
对任意输入点集合 \(\{x_1,\dots,x_n\}\),高斯过程都给出一个联合分布,通常写为 \[ (X(x_1),\dots,X(x_n)) \sim \mathcal N(\mu, \Sigma). \] 其中,\(\mu\) 由均值函数在各点的取值组成,\(\Sigma\) 则由协方差函数在点对之间的计算结果构成。
这一特性使高斯过程能够自然处理插值问题:当某些点已观测而另一些点未观测时,联合分布为后续的条件推断提供了基础。
1.3 与多元高斯分布的关系
高斯过程与多元高斯分布之间存在直接对应关系。前者可以看成后者在索引集上的推广,区别在于高斯过程处理的是无限多个可能输入点,而非固定维度的向量。
这种关系使得高斯过程既保留了高斯分布的可计算性,又扩展到函数层面的建模需求。
1.3.1 有限维投影视角
从有限维投影的角度看,高斯过程是对函数在有限个位置上的“切片”进行联合描述。每一个切片都是一个多元高斯向量,因此可以借助线性代数工具进行分析和推断。
这种视角也解释了为何高斯过程能够与经典高斯模型兼容:只要关注有限维样本,问题就会回落到熟悉的多元正态框架中。
1.3.2 无限维推广含义
高斯过程的“无限维”含义,并不是指必须显式处理无限个参数,而是说它定义在函数空间上。模型的目标对象是一个随机函数,而非有限维参数向量。
这一推广使其适用于函数估计、概率插值和不确定性量化等任务。相比传统参数模型,高斯过程更强调对未知函数整体形状的先验描述。
2 数学表示
高斯过程通常记为 \[ f(x) \sim \mathcal{GP}(m(x), k(x,x')), \] 其中 \(m(x)\) 是均值函数,\(k(x,x')\) 是协方差函数或核函数。二者共同决定随机函数的平均趋势、波动强度与输入之间的关联方式。
2.1 均值函数
均值函数定义为 \[ m(x)=\mathbb E[f(x)]. \] 它描述在给定输入位置上,随机函数的平均水平。若均值函数简单,则模型主要由协方差结构主导;若均值函数复杂,则可显式表达趋势项。
在实践中,均值函数常用于编码先验知识,例如整体偏移、线性趋势或分段变化。
2.1.1 常数均值与非平稳均值
常数均值是最常见的简化形式,表示函数在各处的平均水平近似相同。这种设定便于分析,也常在数据已中心化时使用。
非平稳均值则允许随输入位置变化,适合描述存在趋势漂移、长期上升或下降的过程。此时模型不仅关注局部波动,也保留全局结构信息。
2.2 协方差函数
协方差函数定义为 \[ k(x,x')=\mathbb E[(f(x)-m(x))(f(x')-m(x'))]. \] 它刻画不同输入点处函数值之间的相关程度,是高斯过程最核心的组成部分之一。协方差越大,说明两个位置上的变化越同步。
协方差函数的形式直接影响样本函数的光滑性、周期性以及局部相关范围,因此也被称为核函数的基础。
2.2.1 正定性条件
协方差函数必须满足正定性。对任意有限点集,其构成的协方差矩阵应为半正定矩阵,这样才能保证联合高斯分布是合法的概率分布。
正定性是核函数可用性的前提。若某个函数不满足该条件,就不能直接作为高斯过程的协方差结构。
2.2.2 样本函数相关结构
协方差函数决定样本函数之间的相关模式。若两个输入点很接近且核函数衰减缓慢,则对应函数值通常高度相关,样本曲线看起来较平滑;若相关衰减很快,则函数变化更局部化。
因此,协方差结构不仅影响预测结果,也影响模型对“连续变化”还是“快速波动”的偏好。
2.3 核函数表示
在机器学习语境下,协方差函数通常称为核函数。核函数将输入空间中的距离、角度或结构信息映射为相关性度量,是高斯过程建模中的关键设计对象。
不同核函数对应不同先验假设。选择合适的核,相当于为函数形状规定了合适的表达方式。
2.3.1 线性核
线性核通常写作 \(k(x,x')=x^\top x'\) 或其带偏置形式。它对应线性相关结构,适合描述近似线性变化的函数。
使用线性核时,高斯过程可视作带不确定性的线性回归推广。它的表达能力相对简单,但在某些低维或近似线性场景中非常高效。
2.3.2 高斯核
高斯核,又常称径向基核,具有平滑、局部相关的特点,典型形式为 \[
| k(x,x')=\sigma^2 \exp\left(-\frac{\|x-x'\|^2}{2\ell^2}\right). |
|---|
\] 其中 \(\ell\) 控制相关衰减速度,\(\sigma^2\) 控制整体幅度。
由于其极强的平滑性,高斯核常用于对连续、缓变函数的建模。
2.3.3 多项式核
多项式核一般写作 \(k(x,x')=(x^\top x' + c)^p\)。它允许模型表示更复杂的全局非线性关系,适合包含低阶交互项的场景。
与高斯核相比,多项式核更偏向整体结构而非局部平滑,常用于特征间具有明确代数关系的任务。
2.4 过程样本性质
高斯过程的样本函数性质由核函数决定。不同核会导致样本路径在连续性、可微性和尺度行为上表现出明显差异。
这些性质对于建模很重要,因为它们直接影响拟合函数的“外观”和可解释性。
2.4.1 连续性
当协方差函数足够平滑时,高斯过程的样本函数通常具有连续性。这意味着函数不会频繁出现跳跃,更适合描述自然变化过程。
连续性并不是所有高斯过程都自动具备的,而是由核函数的具体形式决定的。
2.4.2 可微性
样本函数是否可微,取决于核函数在原点附近的平滑程度。越平滑的核,越容易生成可微甚至高阶可微的样本路径。
这一点在物理建模中尤为重要,因为速度、加速度等导数信息往往具有实际意义。
2.4.3 平稳性
若随机过程的统计性质不随输入平移而变化,则称其具有平稳性。对高斯过程而言,平稳性通常体现在协方差只依赖于输入差值而非绝对位置。
平稳设定简化了建模与分析,但在存在明显位置差异时,非平稳模型往往更合适。
3 重要性质
高斯过程之所以被广泛应用,很大程度上得益于其良好的封闭性质和可推断性。它可以在观测、条件化和线性变换下保持高斯结构,便于进行解析计算。
3.1 闭包性质
高斯过程在多种操作下仍能保持高斯形式,这是其理论与应用中的核心优势之一。线性组合、条件分布和积分操作中,都常能保持可处理性。
3.1.1 线性组合
若若干高斯过程相互独立或相关适当,则它们的线性组合仍是高斯过程。该性质使复杂核函数可以通过简单成分叠加构造出来。
例如,不同尺度的核相加后,可同时表达短期波动与长期趋势。
3.1.2 条件分布
高斯过程在条件化后仍保持高斯形式。给定部分观测值后,未观测部分的分布可由条件高斯公式直接求得。
这一性质使得高斯过程非常适合做贝叶斯推断,因为先验与似然结合后仍能得到同类分布。
3.2 边缘分布与条件分布
高斯过程不仅有明确的边缘分布,还具有易于计算的条件分布。观测数据进入模型后,原先的先验分布会更新为后验分布,从而反映新的信息。
3.2.1 观测点上的后验更新
在观测点上,后验分布会收缩不确定性,并使预测均值向观测值靠近。观测越充分,模型对该区域的信心通常越高。
如果观测中包含噪声,则更新结果会兼顾数据拟合与平滑先验,不会完全穿过每个点。
3.2.2 未观测点上的预测分布
在未观测点上,高斯过程会给出预测均值与预测方差。前者表示最可能的函数值,后者描述不确定程度。
这种“均值加方差”的输出形式,是高斯过程区别于许多点估计方法的重要特征。
3.3 平稳高斯过程
平稳高斯过程是指其统计结构不随位置平移而改变的一类过程。在理论与建模中,平稳性是最常见的简化假设之一。
3.3.1 宽平稳与严格平稳
宽平稳通常要求均值为常数、协方差仅依赖于时间差;严格平稳则要求任意阶联合分布在平移后保持不变。前者更常用于高斯过程,因为在高斯情形下,这两个概念联系较紧密。
在实际应用中,人们往往优先采用宽平稳设定,以获得更简洁的协方差结构。
3.3.2 谱表示
平稳高斯过程可以通过谱表示与频域分析联系起来。其协方差函数与频谱之间存在傅里叶变换关系,这使得周期成分、频率分布和随机振荡更易于解释。
谱表示在信号处理、时间序列分析和随机场研究中都具有重要意义。
3.4 马尔可夫性与特殊情形
部分高斯过程还具有马尔可夫性质,即当前状态足以概括过去对未来的影响。这类过程在动态系统建模中十分重要。
3.4.1 布朗运动
布朗运动是最经典的随机过程之一,也可视为高斯过程的特殊实例。它具有独立增量、连续路径和显著的随机波动特征。
在数学金融、物理扩散和随机分析中,布朗运动常作为基础模型出现。
3.4.2 Ornstein-Uhlenbeck过程
Ornstein-Uhlenbeck过程是一类带均值回归特征的高斯过程。它既保留随机扰动,又倾向于回到长期均值附近。
该过程常用于描述受阻尼影响的随机系统,如速度衰减、噪声驱动的平衡过程等。
4 推断与学习
高斯过程模型的实际使用,通常涉及参数估计、核选择与计算优化。由于其理论上优雅、实践中计算成本较高,因此学习算法设计尤为重要。
4.1 参数估计
参数估计主要针对均值函数参数、核函数参数以及噪声水平等进行学习。通过数据,可以反推出最合适的先验结构。
4.1.1 最大似然估计
最大似然估计通过最大化观测数据在模型下出现的概率来确定参数。这种方法直接、常用,且便于与数值优化结合。
在高斯过程里,似然函数通常可写成多元高斯形式,因此参数学习常转化为对数似然最大化问题。
4.1.2 贝叶斯参数学习
贝叶斯参数学习将参数本身视为随机变量,为其设定先验分布,并在观测后求后验。该方法能够更充分地表达参数不确定性。
与点估计相比,贝叶斯方式通常更稳健,但计算也更复杂。
4.2 超参数优化
超参数决定核函数形状、平滑程度和噪声强弱,往往需要通过验证数据或边际似然进行选择。
4.2.1 核参数选择
核参数如长度尺度、幅度和周期等,直接影响模型对数据的拟合方式。合适的参数可使模型既不过度平滑,也不过度追随噪声。
实践中,核参数通常通过梯度优化自动学习。
4.2.2 正则化与模型选择
正则化用于限制模型复杂度,避免核参数导致过拟合。模型选择则是在不同核结构或不同先验假设之间进行比较,选出更适合数据的方案。
这一步往往决定了高斯过程在实际任务中的泛化能力。
4.3 计算复杂度
标准高斯过程的计算代价较高,主要瓶颈来自协方差矩阵的构建、分解与求逆。数据规模增大时,复杂度会迅速上升。
4.3.1 矩阵求逆问题
高斯过程推断中常需处理 \(n\times n\) 协方差矩阵,其求逆或分解通常具有立方级复杂度。这使得大样本情形下的直接计算成本很高。
因此,实际应用常依赖数值分解而非显式求逆。
4.3.2 稀疏近似方法
稀疏近似通过少量代表点近似完整过程,以降低计算和存储压力。它能在较小代价下保留主要结构,适合大规模数据。
这类方法常借助诱导点,将复杂矩阵运算转化为更小规模的问题。
4.3.3 低秩分解方法
低秩分解利用协方差矩阵的近似低维结构,减少计算量。若数据内部存在较强冗余,这种方法尤其有效。
通过截断特征值或构造低秩近似,可以显著提升推断效率。
4.4 数值稳定性
高斯过程对数值误差较为敏感,特别是在协方差矩阵接近奇异或点间距离非常接近时。稳定性处理是实现中的必要环节。
4.4.1 协方差矩阵病态问题
当多个输入点高度相似时,协方差矩阵可能出现病态,导致求解不稳定、精度下降或分解失败。此时即便理论上模型成立,数值上也可能难以计算。
提高稳定性的常见方式包括重新缩放数据、调整核参数或加入微小扰动。
4.4.2 加噪声项处理
在协方差矩阵对角线上加入噪声项,是最常用的稳定化手段之一。它既可以解释为观测误差,也能起到数值正则化作用。
这种处理通常能显著改善矩阵条件数,使推断过程更可靠。
5 典型应用
高斯过程在回归、分类、时间序列和优化等问题中都有广泛应用。其优势在于能够同时提供预测值与不确定性估计。
5.1 高斯过程回归
高斯过程回归是最经典的应用形式,用于从有限样本中恢复未知函数。它不仅拟合数据,还给出对未观测区域的概率预测。
5.1.1 预测均值
预测均值表示在给定观测条件下,未见输入点的期望输出。它通常是训练数据和核结构共同作用的结果。
在平滑核下,预测均值往往呈现插值式变化,能够自然穿过或接近已知样本区域。
5.1.2 预测方差
预测方差反映模型对某一位置的不确定程度。离观测点越远,方差通常越大;观测密集处则往往更小。
这一量化方式使高斯过程不仅能“给答案”,还能说明“有多确定”。
5.2 高斯过程分类
高斯过程也可用于分类任务,但由于类别标签不是连续值,通常需要将潜在函数通过链接函数映射到概率空间。
5.2.1 链接函数
链接函数把高斯过程输出转换为类别概率,常见形式包括逻辑函数和正态累积分布函数。这样便可将分类问题转为概率建模。
链接函数的选择会影响类别边界的平滑程度与校准效果。
5.2.2 近似推断
由于分类似然一般不是高斯形式,后验分布通常无法解析求得,因此需要近似推断方法,如拉普拉斯近似、变分推断或采样法。
这使得高斯过程分类较回归更复杂,但仍保留了不确定性表达能力。
5.3 时间序列分析
在时间序列中,高斯过程可用于拟合趋势、周期波动和随机扰动。它擅长处理不规则采样和局部缺失数据。
5.3.1 趋势建模
通过合适的均值函数或复合核,高斯过程能够描述长期趋势变化,例如缓慢上升、下降或阶段性转折。
它相比固定参数的传统模型,更能灵活适应复杂时间结构。
5.3.2 插值与外推
对于缺测区间,高斯过程可进行插值;对于未来时刻,还可提供一定程度的外推预测。预测范围越远,不确定性通常越大。
这种特点使其特别适合短中期预测和缺失数据补全。
5.4 贝叶斯优化
贝叶斯优化利用高斯过程作为目标函数的代理模型,适合优化代价昂贵、不可导或黑盒型函数。
5.4.1 采集函数
采集函数根据当前后验分布决定下一次采样位置,常在探索与利用之间折中。它指导搜索过程更高效地接近最优点。
常见采集策略会综合考虑预测均值和预测不确定性。
5.4.2 黑盒函数寻优
当目标函数无法直接解析、计算昂贵或噪声较大时,贝叶斯优化尤其有用。高斯过程在其中负责建立代理模型,并逐步缩小搜索范围。
因此,它常用于超参数调优、实验设计和工程优化。
5.5 空间统计
空间统计关注地理位置或空间坐标上的随机现象,高斯过程在这类问题中具有天然优势。
5.5.1 克里金插值
克里金插值是空间统计中的经典方法,与高斯过程回归有密切对应关系。它利用空间相关性估计未知地点的数值,并给出估计误差。
在矿产估计、环境监测和地形重建中应用广泛。
5.5.2 地理数据建模
高斯过程可用于建模温度、降雨、污染等地理变量,处理空间上的平滑变化与局部差异。通过不同核函数,还能体现地形阻隔或方向性相关。
这使其成为地理信息分析的重要工具。
6 常见核函数
核函数决定高斯过程的表达风格,不同核相当于不同的先验假设模板。实际使用中,核函数选择往往与数据特征紧密相关。
6.1 径向基核
径向基核是一类基于距离衰减的核函数,通常具有很强的平滑性和局部相关性。它是高斯过程中最常用的核之一。
6.1.1 平滑性控制
径向基核能生成非常平滑的样本函数,因此适合连续变化、无明显尖角的现象。其平滑程度通常由长度尺度决定。
若长度尺度较大,函数变化更缓慢;若较小,则变化更细碎。
6.1.2 长度尺度参数
长度尺度参数决定输入点之间“多远算相关”。它越大,远距离点仍可能保持相关;它越小,相关性衰减越快。
这个参数直接影响模型对局部细节的敏感程度。
6.2 Matérn核
Matérn核兼顾灵活性与可解释性,能通过参数控制样本函数的光滑程度。相比高斯核,它更适合生成不那么过度平滑的过程。
6.2.1 光滑度参数
Matérn核中的光滑度参数决定样本路径的正则程度。参数越大,函数越平滑;参数较小时,函数更粗糙。
因此,它常用于希望控制“自然程度”而非过度平滑的场景。
6.2.2 可微性影响
该核直接影响样本函数的可微阶数。某些参数设置下,样本路径只具有有限阶可微性,这比高斯核更贴近一些真实数据。
这使其在物理和工程建模中很受欢迎。
6.3 周期核
周期核用于表示重复出现的模式,如季节变化、日夜节律或周期性振荡。它能把周期结构显式编码进模型。
6.3.1 周期结构建模
周期核使相隔一个周期的输入点具有较高相关性,因此适合描述重复波动。结合其他核后,还可同时表示趋势与周期叠加。
这种特性常用于时间序列和信号分析。
6.4 指数核
指数核具有较快的相关衰减,样本函数通常不如高斯核那样光滑。它能体现较强的局部变化。
6.4.1 非平滑样本函数
指数核常生成较粗糙的样本函数,某些情形下只保证连续而不保证可微。对于突变较多或波动较强的数据,这种性质反而更合适。
它在建模短程依赖时较为实用。
6.5 复合核
复合核通过对多个基础核进行加和或乘积构造而成,能够同时表达多种结构特征。它是高斯过程表达能力扩展的重要手段。
6.5.1 核的加和
核相加表示不同模式的叠加,例如趋势核加周期核,可同时建模长期变化和季节波动。加和形式直观,便于解释。
这种构造方式在实际应用中非常常见。
6.5.2 核的乘积
核的乘积通常表示结构之间的耦合,例如周期性在某个局部区域内出现,或平滑性随尺度共同变化。
与加和相比,乘积更强调相互作用和局部组合效果。
7 理论扩展
高斯过程的基本框架可以进一步推广,形成面向复杂数据结构和深层表示的多种变体。
7.1 条件高斯过程
条件高斯过程强调在已知条件下重新刻画随机函数分布。它本质上是先验经由观测更新后的结果。
7.1.1 观测条件化
将观测信息纳入后,原始过程会被条件化为新的高斯过程。其均值和协方差都随条件改变而更新。
这一机制是贝叶斯推断的基础,也使高斯过程具备良好的数据适应性。
7.1.2 先验到后验
高斯过程通常先设定先验,再根据数据得到后验。先验表达模型预期,后验则整合了观测证据。
这种从先验到后验的转换,使其成为典型的贝叶斯非参数方法。
7.2 多输出高斯过程
多输出高斯过程用于同时建模多个相关目标,如多个传感器通道、多个任务变量或多维响应。
7.2.1 相关任务建模
当多个任务之间存在共享结构时,多输出高斯过程可以借助相关性提高学习效率。一个任务的观测信息,可能帮助另一个任务改善预测。
这在多任务学习中很有价值。
7.2.2 协方差矩阵结构
多输出模型的协方差结构更复杂,通常需要同时描述输入间相关性与输出间相关性。相应矩阵常具有块结构或可分结构。
这种设计既增强表达力,也增加了计算难度。
7.3 深度高斯过程
深度高斯过程将多个高斯过程层级堆叠,形成深层随机映射。它结合了高斯过程的不确定性表达与深层模型的表示能力。
7.3.1 层级组合
通过层与层之间的输出传递,深度高斯过程可以形成更复杂的非线性变换。每一层都像一个随机函数映射,整体构成逐层抽象的结构。
这使其能够捕捉普通单层模型难以表达的复杂模式。
7.3.2 非线性表示学习
深度结构为表示学习提供了更强的灵活性。模型可以自动学习适合数据的中间表示,再在更高层完成预测。
不过,这类模型通常训练更难,也更依赖近似推断。
7.4 稀疏高斯过程
稀疏高斯过程旨在缓解标准模型的计算瓶颈,适合大规模数据处理。
7.4.1 诱导点方法
诱导点方法选取少量代表性位置作为中间变量,用它们近似整个过程。这样可显著降低矩阵规模与计算成本。
诱导点的选择质量通常直接影响近似效果。
7.4.2 变分推断
变分推断为稀疏高斯过程提供了可优化的近似框架。通过构造变分分布,可在效率与精度之间取得平衡。
该方法在现代大数据高斯过程实现中十分常见。
7.5 非平稳高斯过程
非平稳高斯过程允许统计性质随位置变化,更贴近许多真实系统的局部差异。
7.5.1 位置相关核
位置相关核让协方差结构显式依赖输入位置,而不仅仅依赖距离。这样不同区域可具有不同的相关尺度或波动幅度。
这对于空间异质性明显的数据尤其重要。
7.5.2 局部平滑性变化
非平稳模型可描述某些区域平滑、某些区域粗糙的现象。它能够捕捉变化率在不同位置上的差异,从而提升拟合的贴合度。
这种能力在复杂自然数据和工程场景中很实用。
8 历史与发展
高斯过程的发展经历了从经典随机过程理论到统计建模,再到机器学习方法广泛应用的过程。其思想长期存在,但在不同领域中获得了不同名称和实现方式。
8.1 早期随机过程研究
高斯过程的理论根源可追溯到随机过程、概率论和高斯分布的早期研究。数学家们逐步认识到,随机函数也可以像随机变量一样进行概率刻画。
这些研究为后来的时序分析与随机场理论奠定了基础。
8.2 统计学中的克里金理论
在统计学和地学领域,克里金方法较早系统使用了相关结构来进行空间预测。它强调利用观测点之间的协方差关系推断未观测位置的值。
这一思想与现代高斯过程回归高度一致,构成了二者的重要桥梁。
8.3 机器学习中的复兴
随着贝叶斯方法和核方法在机器学习中兴起,高斯过程重新受到关注。它以非参数、可解释和带不确定性估计的特点,成为重要的概率学习工具。
尤其在小样本、高代价实验和黑盒优化中,它显示出独特优势。
8.4 现代算法与大规模实现
近年来,高斯过程研究重点逐渐转向可扩展性、近似推断和自动化核学习。稀疏方法、随机特征、变分技术等手段不断成熟,使其更适用于大数据环境。
与此同时,现代软件框架也降低了使用门槛,让高斯过程在工程实践中更易部署。