1 定义与数学形式
1.1 标准表达式
高斯径向基核(Radial Basis Function Kernel,简称RBF核)的标准数学表达式为:
| \[ K(\mathbf{x}, \mathbf{y}) = \exp\left(-\gamma \|\mathbf{x} - \mathbf{y}\|^2\right) \] |
|---|
| 其中,\(\mathbf{x}\)和\(\mathbf{y}\)是输入空间中的两个样本点,\(\|\cdot\|\)表示欧氏范数,\(\gamma\)是一个正常数。 |
|---|
1.2 参数说明
1.2.1 带宽参数 γ(gamma)
参数γ(或有时记为\(1/(2\sigma^2)\))控制核函数对距离的敏感程度:γ值越大,相似性随距离增加衰减得越快,决策边界越复杂、局部性越强;γ值越小,衰减越慢,模型倾向于全局平滑。γ的取值直接影响模型的复杂度与泛化能力。
1.2.2 距离度量方式
RBF核采用欧氏距离(L2范数)作为基础度量。这意味着核函数的值完全由样本点之间的直线距离决定,不受坐标轴方向影响。这一特性赋予核函数平移不变性和旋转不变性(见2.2和2.3节)。
1.3 与高斯函数的关系
| RBF核的函数形式与概率论中的高斯分布(正态分布)概率密度函数具有相同的结构。事实上,若视核函数为\(\mathbf{x}\)固定为原点的函数,则\(K(0, \mathbf{y}) = \exp(-\gamma \|\mathbf{y}\|^2)\)恰为未归一化的高斯函数。但需注意,RBF核在机器学习中并非概率密度,而是用于度量样本间相似性的确定性函数。 |
|---|
2 性质与特点
2.1 正定性
RBF核是正定核,即对于任意有限点集,其核矩阵是对称半正定的。这一性质保证了使用RBF核的优化问题(如SVM的对偶问题)是凸的,存在全局最优解——这也是为什么它被最广泛使用的原因之一。
2.2 平移不变性
若对所有样本施加相同的平移向量\(\mathbf{t}\),则核函数值保持不变:\[ K(\mathbf{x}+\mathbf{t}, \mathbf{y}+\mathbf{t}) = K(\mathbf{x},\mathbf{y}) \] 这是由于欧氏距离在平移下不变。在机器学习中,这意味着模型不依赖于数据的绝对位置,只关心样本间相对差异。
2.3 旋转不变性
| 若同时对\(\mathbf{x}\)和\(\mathbf{y}\)施加同一个旋转(正交变换)\(\mathbf{R}\),则欧氏距离保持不变:\[ \|\mathbf{R}\mathbf{x} - \mathbf{R}\mathbf{y}\| = \|\mathbf{x} - \mathbf{y}\| \] 因此核函数值也不变。这赋予模型对坐标轴方向的中立性,适用于特征维度无天然顺序的数据。 |
|---|
2.4 无限维特征映射
2.4.1 Mercer定理与核技巧
根据Mercer定理,任何正定核对应一个高维(甚至无限维)特征空间中的内积。RBF核的Taylor展开可表示为无穷级数,每一项对应一个特征函数,从而证明其映射到无限维空间。核技巧允许直接计算内积,而无需显式构造高维向量。
2.4.2 隐式特征空间解释
RBF核将原始数据隐式映射到无限维希尔伯特空间。在该空间中,原本线性不可分的问题可能变为线性可分。这一特性是SVM使用RBF核处理后能够拟合复杂非线性边界的关键。
3 参数选择与调优
3.1 带宽参数的影响
3.1.1 过拟合与欠拟合
γ的过大取值会导致核函数只在极近的点间非零,模型沦为“记忆训练样本”,造成严重过拟合。反之,γ过小则使核函数对所有距离大致相同,模型退化为近乎线性分类器,导致欠拟合。合理γ的选择需平衡二者。
3.1.2 经验规则:Silverman规则
在密度估计和核方法中,存在经验公式\[ \sigma = \left(\frac{4}{n(d+2)}\right)^{1/(d+4)} \] 其中n为样本数、d为特征维数——它来自Silverman的核密度估计理论。该规则可提供γ的初始猜测,但未必适用于具体分类任务,通常仍需交叉验证调整。
3.2 正则化参数(C)的配合
3.2.1 软间隔SVM中的权衡
在软间隔SVM中,正则化参数C控制模型对误分类样本的惩罚力度。小C容忍更多误分,偏好平滑模型;大C强求正确分类,可能导致边界复杂。RBF核的γ与C需联合调节:大γ时易过拟合,需小C缓解;小γ时模型简单,大C适当提高拟合能力。
3.2.2 交叉验证方法
常用网格搜索(grid search)配合k折交叉验证(如5折或10折)寻找最优(γ, C)组合。搜索可基于对数尺度(如γ=2^{-15},2^{-13},...,2^{3};C=2^{-5},2^{-3},...,2^{15}),避免线性搜索遗漏最优值。
4 应用场景
4.1 支持向量机分类
4.1.1 非线性边界拟合
RBF核是SVM中最受欢迎的核函数,用于生成非线性决策边界。它能够在特征空间中构造复杂分界面,适应数据的高斯分布或簇状分布,经典应用包括字符识别、图像分类、生物信息学中的蛋白质结构预测。
4.1.2 多类扩展策略
SVM本为二分类设计,多类场景通常采用一对多(one-vs-rest)或一对一(one-vs-one)策略。RBF核配合这些策略时,每个子分类器都需独立优化γ与C,可能带来计算开销,但效果通常优于线性核。
4.2 高斯过程回归
4.2.1 协方差函数(核)
在高斯过程回归中,RBF核作为协方差函数的一种选择,编码函数平滑性的先验信念。其可导性与旋转对称性使模型能够灵活地对平滑函数建模,适用于时间序列预测、机器人控制等场景。
4.2.2 超参数学习
高斯过程的超参数(如γ和信号方差)通常通过极大化对数边际似然来学习(第Ⅱ类最大似然)。这一过程自动权衡模型复杂度与数据拟合度,无需强依赖交叉验证。
4.3 核主成分分析(KPCA)
4.3.1 非线性降维
RBF核用于核主成分分析(KPCA),可捕获数据中的非线性结构(如流形)。通过计算核矩阵的特征分解,提取出低维非线性主成分,常用于手写数字、人脸识别等可视化任务。
4.3.2 与线性PCA对比
线性PCA只能处理数据中的线性相关性,而RBF核的KPCA能发现弯曲的流形路径。然而,KPCA需选择核参数且计算核矩阵O(n²)内存,在大规模数据集上不如线性PCA高效。
5 与其他核函数的比较
5.1 与多项式核的对比
5.1.1 全局性与局部性
多项式核\[K(\mathbf{x},\mathbf{y})=(\mathbf{x}^\top\mathbf{y}+c)^d\]具有全局性:距离远的点也能产生非零内积影响。RBF核则表现为局部性:核值仅在大致邻域内显著,对远点近似为零。局部核通常对局部变化更敏感,模型更灵活。
5.1.2 参数数量差异
多项式核有三个可调参数(偏移常数c、阶数d、可能还有缩放因子),而RBF核仅一个参数γ。RBF核的参数调优范围通常更直观,也更容易通过网格搜索寻优。
5.2 与Sigmoid核的对比
5.2.1 正定性条件
Sigmoid核\[K(\mathbf{x},\mathbf{y})=\tanh(\alpha\mathbf{x}^\top\mathbf{y}+c)\]仅在特定参数下(如α>0, c<0且绝对值较大)才是正定核,否则核矩阵不正定,可能导致优化问题不收敛。RBF核在所有γ>0下自动为正定,使用条件更宽松。
5.2.2 实际性能差异
在典型的SVM分类任务中,RBF核通常优于Sigmoid核:后者在某些数据集上表现不稳定(对参数α, c敏感),且缺乏无限维映射的几何直觉。RBF核因此成为业界更主流的“默认选择”。
5.3 与拉普拉斯核的对比
5.3.1 平滑性
| RBF核是无限可微的(光滑函数),而拉普拉斯核\[K(\mathbf{x},\mathbf{y})=\exp(-\alpha\|\mathbf{x}-\mathbf{y}\|_1)\]在原点处一次可微。因此RBF核生成的是更平滑的决策边界,拉普拉斯核则更“锐利”。 |
|---|
5.3.2 对异常值的敏感度
拉普拉斯核使用L1距离,对异常值的惩罚(绝对值)比RBF核的平方差(L2)轻,因而在数据含明显噪声或离群点时,拉普拉斯核可能更鲁棒。RBF核则因平方项将大距离的差异放大,更容易受极端点影响。
6 计算与数值问题
6.1 距离矩阵计算
6.1.1 欧氏距离的向量化实现
计算RBF核的核心操作是批量计算所有样本对间的欧氏距离(产生核矩阵)。高效实现可利用公式:
| \[ \|\mathbf{x}_i-\mathbf{x}_j\|^2 = \|\mathbf{x}_i\|^2 + \|\mathbf{x}_j\|^2 - 2\mathbf{x}_i^\top\mathbf{x}_j \] |
|---|
从而避免显式循环,使用矩阵乘积和广播运算加速(如NumPy的向量化操作)。
6.1.2 高维数据下的维度灾难
随着特征维度上升,所有样本间的欧氏距离趋向相等(球形散布),RBF核的区分能力急剧下降。此时若γ未相应调整,模型面临失效风险。通常需先降维(如PCA)或使用各向异性核(见7.1节)缓解。
6.2 数值稳定性
6.2.1 小γ时的病态条件
当γ非常小(如<0.001)时,所有核函数值均接近1,核矩阵几乎为全1矩阵(秩1),特征值趋近于零,优化问题病态。这会导致梯度消失或收敛困难,实际中应避免使用过小γ。
6.2.2 核矩阵条件数控制
核矩阵的条件数(最大特征值与最小特征值之比的绝对值)对数值求解至关重要。条件数过大时(如>10¹²),线性求解器可能产生大误差。常用稳定措施包括:添加较小的正则化项(例如在核矩阵对角线上加1e-10)、避免γ过小或过大。
7 扩展与变体
7.1 各向异性RBF核
7.1.1 对角协方差矩阵
标准RBF核在所有维度上使用相同的γ(各向同性)。各向异性版本引入对角协方差矩阵\(\boldsymbol{\Sigma}=\mathrm{diag}(\sigma_1^2,\dots,\sigma_d^2)\),核形式变为: \[ K(\mathbf{x},\mathbf{y}) = \exp\left(-\sum_{j=1}^d \frac{(x_j-y_j)^2}{2\sigma_j^2}\right) \] 每个维度具有独立的尺度参数,可自适应不同特征的重要性。
7.1.2 自动相关性确定(ARD)
ARD(Automatic Relevance Determination)是各向异性RBF的贝叶斯解释:通过最大化边际似然,自动学习每个维度的\(\sigma_j^2\)。若某维度的\(\sigma_j^2\)趋于无穷大,则该维度被模型忽略,实现了内在的特征选择。
7.2 指数核与马特恩核
7.2.1 光滑性等级
马特恩核族(Matern kernel)提供一个平滑度参数ν来控制函数的光滑性:ν=1/2时退化为拉普拉斯核(不可导);ν→∞时极限为RBF核(无限可导)。指数核则是马特恩核ν=1/2的特殊情况。RBF核是马特恩族中极光滑的特例。
7.2.2 与RBF核的继承关系
马特恩核和RBF核同属稳恒各向同性核(isstationary kernel),均基于距离度量。RBF核是其中最光滑、参数最少的成员。当实际函数未知时,RBF核常被用作默认选项,但对于分段光滑或尖锐变化数据,马特恩核(ν=3/2或5/2)可能更贴合真实生成过程。