1 定义与基本思想
Jeffreys先验是贝叶斯统计中一种由模型本身导出的默认先验。它不依赖研究者主观指定某个参数值更“合理”,而是借助参数化模型的局部信息结构来构造分布,因此常被视为一种较为客观的起点。
1.1 贝叶斯先验的概念回顾
在贝叶斯框架中,先验分布用于描述在观察数据之前,对参数可能取值的初始信念。它与似然函数结合后,可通过贝叶斯公式得到后验分布,从而反映数据更新后的不确定性。
先验并不等同于“猜测”,而是推断过程的一部分。不同先验会在样本较少时产生不同的后验结果,因此先验选择在贝叶斯分析中具有重要地位。
1.2 Jeffreys先验的提出背景
Jeffreys先验由Harold Jeffreys提出,目的是为缺乏明确先验知识的情形提供一种规则化选择。其核心诉求是避免人为指定某一参数尺度更有偏好,从而使先验更接近“无信息”或“中性”的角色。
这种先验特别适合单参数问题,以及一些结构较清晰、参数解释明确的模型。它在历史上推动了客观贝叶斯方法的发展。
1.3 基于费舍尔信息的构造
Jeffreys先验的构造依赖费舍尔信息量。费舍尔信息刻画了数据对参数识别能力的强弱:当某个参数附近信息较多时,先验权重相应较小;信息较少时,权重相对较大。
直观上,这意味着先验分布会对“参数空间中更难区分的区域”给予更多质量,从而形成一种与模型曲率相适应的分布。
1.4 参数重参数化不变性
Jeffreys先验最著名的性质之一,是在单参数情形下对重参数化具有不变性。也就是说,如果将参数从一种表达方式改写成另一种等价表达方式,Jeffreys先验会按相应变换保持一致的形式。
这一点使其在理论上显得自然:先验不再依赖于参数采用哪种坐标描述,而是由模型本身的统计结构决定。
2 数学表达
2.1 单参数情形
在单参数模型中,Jeffreys先验通常可由费舍尔信息的平方根给出。它在形式上简洁,且容易应用于许多标准分布模型。
2.1.1 费舍尔信息的定义
设参数为 \(\theta\),观测变量为 \(X\),似然函数为 \(p(x\mid \theta)\)。费舍尔信息常写为 \[ I(\theta)=\mathbb{E}\left[\left(\frac{\partial}{\partial \theta}\log p(X\mid\theta)\right)^2\right], \] 其中期望取自参数为 \(\theta\) 时的分布。
在适当条件下,它也可写成对数似然二阶导数的负期望形式。该量反映参数估计的局部精度。
2.1.2 Jeffreys先验公式
单参数情况下,Jeffreys先验一般写为 \[ \pi_J(\theta)\propto \sqrt{I(\theta)}. \]
这里的比例符号表示先验未必天然可归一化;若积分有限,可进一步标准化为概率分布。若积分发散,则形成非正规先验。
2.2 多参数情形
当参数向量为 \(\boldsymbol{\theta}\) 时,Jeffreys先验扩展为利用费舍尔信息矩阵构造。
2.2.1 行列式形式
多参数情形常写为 \[ \pi_J(\boldsymbol{\theta})\propto \sqrt{\det I(\boldsymbol{\theta})}, \] 其中 \(I(\boldsymbol{\theta})\) 是费舍尔信息矩阵。
这一形式继承了单参数情况下“信息越强,先验权重越小”的思想,但在多维空间中会引入更复杂的几何与计算问题。
2.2.2 参数空间的度量解释
费舍尔信息矩阵可视为参数空间上的局部度量。其行列式的平方根与体积元素相关,因此Jeffreys先验也可理解为在该信息几何度量下的自然体积测度。
这种解释使其与微分几何和黎曼度量产生联系,说明它并非任意规定,而是与模型空间结构紧密相连。
2.3 归一化与非正规先验
2.3.1 可积先验与不可积先验
若 \(\int \pi_J(\theta)\,d\theta\) 有限,则Jeffreys先验可以归一化,称为可积先验。若积分无限,则它只作为比例意义上的先验使用,属于非正规先验。
许多经典模型的Jeffreys先验都属于后者,例如均值参数取全实数范围时往往给出常数型先验。
2.3.2 后验可得性的讨论
即便先验本身不可积,只要与似然结合后得到的后验可积,贝叶斯推断仍然可以正常进行。问题在于,不可正规先验有时会使后验是否适当需要额外验证。
因此,实际应用中通常要检查样本量、模型结构以及参数边界条件,避免出现后验发散或不唯一的情况。
3 理论性质
3.1 不变性与客观性
Jeffreys先验的主要优点在于重参数化不变。这意味着它不像某些主观先验那样依赖参数写法,而是尽量保持“换坐标不换判断”。
这种性质增强了它作为默认选择的合理性,也使其成为客观贝叶斯讨论中的重要工具。
3.2 与最大熵思想的关系
Jeffreys先验与最大熵思想都试图在约束条件下保持尽可能少的主观偏好。两者的出发点相近,但侧重点不同:最大熵通常围绕分布熵的极大化,而Jeffreys先验则基于参数空间的信息结构。
因此,它们在某些模型中可能得出相近结果,但并不等价。
3.3 与信息几何的联系
从信息几何角度看,参数空间上的费舍尔信息矩阵定义了局部几何结构。Jeffreys先验对应于这一几何结构的自然测度,因此可视为在统计流形上的体积元素。
这一联系使其在理论统计和几何化推断中具有特殊地位。
3.4 作为无信息先验的地位
Jeffreys先验常被称为无信息先验,但这一说法需要谨慎理解。它并不意味着“完全没有信息”,而是尽量减少对参数尺度和位置的额外偏好。
换言之,它是一种弱假设、低偏置的默认先验,而不是严格意义上的“空白”。
4 常见模型中的 Jeffreys 先验
4.1 伯努利分布
伯努利分布的参数为成功概率 \(p\),是Jeffreys先验最常见的示例之一。
4.1.1 成功概率参数的先验形式
对于伯努利分布,Jeffreys先验为 \[ \pi(p)\propto p^{-1/2}(1-p)^{-1/2}, \] 即Beta\((1/2,1/2)\)形式。
它在 \(p\) 接近0或1时权重较高,反映出边界附近信息较弱的特征。
4.2 二项分布
二项分布的成功概率参数与伯努利情形相同,因此Jeffreys先验也具有同样形式,即Beta\((1/2,1/2)\)。
这使得它在二项数据的后验更新中非常常用,尤其适合样本数较小的情形。
4.3 泊松分布
对泊松分布的强度参数 \(\lambda\),Jeffreys先验通常为 \[ \pi(\lambda)\propto \lambda^{-1/2}. \]
该形式体现了泊松率在小值附近的不确定性较强,故先验权重更高。由于 \(\lambda\) 的取值范围为正实数,这一先验通常是非正规先验。
4.4 正态分布
正态分布是Jeffreys先验应用最广的模型之一,尤其在均值和方差分别已知或未知时,会得到不同形式。
4.4.1 已知方差时的均值先验
若正态分布方差已知、均值为未知参数,则均值的Jeffreys先验为常数,即 \[ \pi(\mu)\propto 1. \]
这表示在整个实数轴上对均值没有额外偏好。
4.4.2 已知均值时的方差先验
若均值已知、方差 \(\sigma^2\) 为未知参数,则Jeffreys先验为 \[ \pi(\sigma^2)\propto (\sigma^2)^{-1}. \]
若以标准差 \(\sigma\) 表示,则常写为 \[ \pi(\sigma)\propto \frac{1}{\sigma}. \]
这种形式在尺度参数问题中十分典型。
4.5 指数分布
对于指数分布的率参数 \(\lambda\),Jeffreys先验同样为 \[ \pi(\lambda)\propto \lambda^{-1}. \]
这与其尺度结构一致,也体现了对参数取值尺度不作偏置的思想。
5 统计推断中的应用
5.1 后验分布的构造
Jeffreys先验常作为后验计算的起点。将它与似然函数相乘后,可得到后验分布,并据此进行区间估计、点估计和预测分析。
在共轭模型中,使用Jeffreys先验往往能得到简洁的后验形式,便于解析处理。
5.2 置信区间与可信区间
在贝叶斯分析中,Jeffreys先验得到的后验区间称为可信区间。由于其构造具有某些频率学性质,在不少标准模型里,这类区间与传统置信区间会呈现相近表现。
因此,它有时被用于作为连接贝叶斯与频率学结果的桥梁。
5.3 假设检验中的作用
在贝叶斯假设检验中,先验选择会影响边际似然和贝叶斯因子。Jeffreys先验因其默认性常被用于构造检验中的参数先验。
不过,在模型比较中,非正规先验可能带来常数项不确定的问题,因此需要谨慎处理,尤其在不同模型之间共享先验尺度时。
5.4 贝叶斯估计与点估计
Jeffreys先验得到的后验分布可进一步导出不同类型的点估计,包括后验均值、后验中位数和后验众数。
5.4.1 后验均值
后验均值是平方损失下的最优估计,通常具有良好的平滑性。若后验分布偏斜,均值可能受尾部影响较明显。
5.4.2 后验中位数
后验中位数对极端值更稳健,适合后验分布偏斜或长尾的情形。在某些尺度参数问题中,它比均值更容易解释。
5.4.3 后验众数
后验众数对应后验密度最大的点,也常被称为最大后验估计。它在形式上直观,但在多峰后验中可能不唯一。
6 优点与局限
6.1 优点
6.1.1 构造简单
Jeffreys先验通常只需计算费舍尔信息即可得到,操作上较为直接。对于标准分布族,这种构造往往能迅速写出闭式结果。
6.1.2 变换不变
其最重要的优点之一是参数重参数化不变,使分析结果不依赖于参数的命名方式或表示坐标。
6.1.3 适合作为默认先验
在缺少明确领域知识时,它常被视为较自然的起点,能够降低人为主观指定先验的影响。
6.2 局限
6.2.1 多参数模型中的歧义
在多参数问题中,不同参数子集、不同优先顺序或不同目标函数可能导出不同的“Jeffreys型”选择,因此其唯一性会变弱。
6.2.2 非正规先验问题
许多Jeffreys先验不可归一化。虽然不一定妨碍后验分析,但会使理论处理和模型比较更为复杂。
6.2.3 对边界参数的敏感性
当参数位于边界附近时,费舍尔信息可能出现奇异或趋于无穷,从而导致先验在边界附近权重过高或过低,影响推断稳定性。
6.2.4 可能导致不适当后验
在某些样本量过小或结构特殊的模型中,使用Jeffreys先验后可能得到不适当后验,即后验分布无法归一化。这需要在应用前仔细检验。
7 相关扩展与变体
7.1 参考先验
参考先验是一类与Jeffreys先验相关的客观先验方法,强调使后验尽可能从数据中获得信息。它通常更适合复杂参数结构和多参数场景。
7.2 先验预测分布视角
从先验预测分布出发,也可以理解无信息先验的构造方式。该视角关注在观察数据前,模型对未来观测的整体表现,因而更贴近预测任务。
7.3 层次模型中的推广
在层次模型中,Jeffreys先验可推广到超参数或局部参数,但具体形式往往更复杂。此时常需要结合层次结构、可识别性和后验适当性进行综合判断。
7.4 改进型非信息先验
为克服Jeffreys先验在某些场景下的局限,统计学界发展出多种改进型非信息先验,例如偏好更稳定的尺度先验、边界修正先验或面向特定参数的客观先验。
这些方法保留了“少主观性”的目标,同时增强了应用上的稳健性。
8 历史与影响
8.1 Harold Jeffreys 的贡献
Harold Jeffreys在贝叶斯统计与科学推断方面具有开创性贡献。他提出的先验构造方式,将模型信息结构引入先验选择,形成了影响深远的方法论。
8.2 在贝叶斯统计发展中的地位
Jeffreys先验是客观贝叶斯方法的重要组成部分。它促使研究者从“如何设先验”转向“如何基于模型结构设先验”,从而推动了先验理论的系统化。
8.3 在现代统计软件中的应用
许多统计软件和贝叶斯建模工具都支持默认先验设置,其中Jeffreys型先验常作为理论参考或分析起点出现在教学与实务场景中。
不过,在实际软件实现里,通常还会结合数值稳定性、可计算性与后验适当性做出调整。
8.4 与“客观贝叶斯”流派的关系
Jeffreys先验经常被视为客观贝叶斯流派的代表性工具之一。该流派希望尽量减少人为主观输入,并通过规则化的先验生成方式提升推断的一致性与可比性。
与此同时,客观贝叶斯并不只依赖Jeffreys先验,还包括参考先验、匹配先验等多种扩展路线。