1 概述与基本定义
似然比卡方统计量(Likelihood Ratio Chi-square Statistic),常记作 G 检(G-test),是一类基于“对数似然差”的检验统计量。其出发点是把“数据在某个概率模型下出现的可能性”量化:若在原假设所代表的模型条件下,数据的出现并不比备择模型差太多,则证据不足以拒绝原假设;反之若原假设下的对数似然显著更差,表明原假设可能无法充分解释观测数据。
在列联表或一般离散计数场景中,G 棧测“观测频数分布”与“模型期望分布”之间的差异。其核心直觉可以概括为:模型若与数据生成机制贴合,则二者对数似然的差距应较小;当样本量增大且原假设成立时,这个差距的统计波动会呈现可用卡方分布近似来刻画。
1.1 似然比检验与对数似然差
似然比检验比较两套模型:一套满足原假设(通常更受约束),另一套相对更灵活以便贴近数据(通常对应备择假设或“饱和模型”)。似然比是两者似然的比值;在实践中常使用对数似然比,因为它把乘积形式变为加和形式,数值更稳定,也更容易与渐近理论建立联系。
对数似然差衡量了“限制带来的损失”。若限制模型仍能取得与更自由模型几乎相同的解释能力,则统计证据不足;若限制模型显著降低对数似然,则通常对应更强的拒绝倾向。
1.2 G 检(G-test)的统计量形式
在常见的列联表检验中,设观测计数为 \(O_i\),在原假设下对应的期望计数为 \(E_i\)。G 检统计量可写为 \[ G = 2\sum_i O_i\ln\left(\frac{O_i}{E_i}\right), \] 其中对数项刻画每个单元格中“观测偏离期望的幅度”。当 \(O_i=0\) 时,项 \(O_i\ln(O_i/E_i)\) 的极限取值为 0(见后续处理原则)。
该形式体现了对数似然差的本质:它并非简单平方误差,而是以对数比例来累积“相对可能性损失”。
1.3 与卡方分布的渐近关系(大样本近似)
在大样本条件下,如果原假设为真且模型参数可由最大似然估计获得,则 G 统计量可近似服从卡方分布: \[ G \overset{approx}{\sim} \chi^2_{\text{df}}, \] 自由度 \(\text{df}\) 由原假设施加的约束数量决定(或等价地由两个嵌套模型的参数维度差决定)。因此可用卡方分布来计算 \(p\) 值,从而进行统计推断。
这种“渐近卡方”结论使得 G 检具备了可操作的检验框架:在样本足够大时,可以将对数似然差的大小转化为与卡方分布的偏离程度。
2 数学表达式与推导框架
2.1 单参数/一般模型下的似然比
从一般的统计模型出发,令 \(\mathcal{M}_0\) 表示满足原假设的受约束模型,\(\mathcal{M}_1\) 表示更一般的备择模型。二者可嵌套(即 \(\mathcal{M}_0\subset \mathcal{M}_1\))。以最大似然估计得到的对数似然分别为 \(\ell_0\) 与 \(\ell_1\),则似然比检验统计量常以 \[ -2(\ell_0-\ell_1)=2(\ell_1-\ell_0) \] 的形式出现。G 检就是在常用离散/列联表设定下,把该一般统计量写成了以观测与期望计数为核心的可计算表达。
2.2 列联表场景中的观测与期望计数
列联表中通常把类别单元索引为 \(i\)。当样本被分配到多个类别,且在原假设下各类别概率由某种结构(如独立性或同质性)决定时,期望计数为 \[ E_i = n p_i(\text{原假设参数}), \] 其中 \(n\) 为总样本量,\(p_i\) 为由原假设得到的概率。观测计数 \(O_i\) 来自数据。
若采用最大似然估计在原假设下得到最优 \(p_i\),则 \(E_i\) 也相应随估计而确定。G 统计量通过 \(\ln(O_i/E_i)\) 把“观测相对期望的比例差”转化为累积证据。
2.3 对数似然差到 G 统计量的转换
在多项式计数模型(或其在列联表分析中的等价框架)下,观测数据的对数似然与 \(\sum O_i\ln p_i\) 相关。受约束模型下的对数似然比自由模型低,其差值在化简后会出现 \(\sum O_i\ln(O_i/E_i)\) 的结构,从而得到 \[ G = 2\sum_i O_i\ln\left(\frac{O_i}{E_i}\right). \] 因此,G 检并不是凭空定义的“卡方变体”,而是似然比检验在列联表计数模型下的常用实现。
2.4 自由度的确定原则
自由度来源于嵌套模型的参数维度差。直观上,原假设越“严格”(约束越多),可自由调整以贴近数据的参数越少,\(\text{df}\) 越大,统计量在原假设下的分布近似也需要更多自由度来描述这种限制带来的波动。
在列联表独立性检验、同质性检验、或带有固定边际约束的拟合检验中,自由度可通过“约束前后独立参数数量”计算得到。不同表结构的具体公式会有所差异,但原则一致:比较受约束模型与更一般模型之间的可估参数差。
2.5 连续与离散模型中的适用性要点
G 检最常被用于离散计数(如列联表)场景。对于连续数据,若可以在某种离散化(例如分箱)下使用计数似然,也可得到对应形式;但当模型更自然地是连续概率分布时,G 检思想依然存在,但表达通常以“对数似然比”形式出现,而不必直接写成 \(2\sum O\ln(O/E)\)。
因此,关键并非必须是“频数”,而是检验统计量由对数似然差构造,并在合适条件下给出渐近卡方近似。
3 典型应用:列联表检验
3.1 独立性检验(行列独立)
在二维列联表中,独立性检验通常比较“行类别”和“列类别”是否相互独立。原假设规定行与列的联合概率由边际概率乘积给出,因此期望计数由边际总量确定。
若观测表中存在显著偏离独立结构的模式(例如某些格子的计数明显高于或低于独立预期),则会增大 \(G\) 值并触发拒绝原假设。
3.2 同质性检验(不同组的分布差异)
同质性检验关注:多个组的类别分布是否相同。这里的原假设通常认为各组共享同一组类别概率;期望计数根据“总体类别比例”与“各组样本量”组合得到。
若某些组的类别结构系统性偏离总体比例,则对数似然差会增大,从而支持“同质性不成立”的结论。
3.3 给定边际约束下的模型拟合
在更一般的拟合检验中,原假设可能对应某种结构模型,例如固定某些边际总量(或等价的边际概率)并允许其他部分由该约束模型确定。G 检可用于检验“观测计数是否与该约束模型一致”。
这种用法常见于层级模型或结构化概率模型的比较:通过把约束视为“受限模型”,把自由程度视为“更一般模型”,用似然比实现总体差异评估。
3.4 与其他拟合检验在目的上的区分
列联表分析中常见的拟合检验包括基于不同目标函数的统计量。G 检强调对数似然差(与信息论意义相关),而一些替代方法强调几何或平方误差形式。尽管二者都能用于检验“拟合是否足够好”,但它们对不同类型偏差的敏感度可能不同,尤其在期望计数较小或模型形式更贴合数据生成机制时,差异更容易显现。
4 与皮尔逊卡方检验的比较
4.1 目标函数形式差异(对数似然 vs 平方误差)
皮尔逊卡方检验通常使用 \[ X^2=\sum_i \frac{(O_i-E_i)^2}{E_i}, \] 它度量的是观测与期望之间的平方偏差,并以期望为尺度进行加权。G 检则使用 \[ G=2\sum_i O_i\ln\left(\frac{O_i}{E_i}\right), \] 本质上是对比“相对概率/相对可能性”的对数差。两者都可看作“从原假设到饱和模型的差异”的近似度量,但代数形式不同。
4.2 小样本时的表现与经验建议
当期望频数较小,平方误差型度量与对数似然型度量可能出现不一致的行为。实践中常见的经验建议是:当某些单元格的期望计数偏小,G 棄往往被认为更贴近似然推断的思想,或者在某些资料中被推荐作为更稳健的选择;但最终仍应结合具体样本量、模型设定以及软件实现方式综合判断。
4.3 何时选择 G 检更合适(直觉与实践)
当数据生成机制更符合“概率在类别上的乘法结构”(典型的计数似然),且希望统计量与似然推断保持一致性时,G 检常被认为更直观。它把偏差转化为“对数可能性损失的累积”,与极大似然框架天然兼容。
此外,如果研究者更关注相对差异或信息类解释(例如“模型相对饱和模型损失了多少信息”),G 检的对数形式更容易建立解释链条。
4.4 两者结论可能不同的常见原因
两种统计量在大样本下通常趋于类似的结论,但在以下情形差异更可能出现: 1) 期望计数较小或分布高度不均衡,导致线性化近似不充分; 2) 模型结构使得对数似然更贴合数据生成,平方误差刻画相对失真; 3) 在边界情形(如出现许多零观测)时,二者对这种离散性处理的有效性会不同。
因此,差异并不必然意味着“某个方法错误”,而常反映了近似精度与数据特征之间的匹配程度。
5 计算与实现注意事项
5.1 期望频数为零或极小的处理
若某个单元在原假设下期望为零,则 \(O_i>0\) 时无法计算对数比值,因为 \(O_i/E_i\) 发散。这通常意味着原假设模型对该类别分配了零概率,而观测却出现了该类别,理论上应当立即判定原假设与数据冲突,实际计算中需要根据软件策略或建模方式调整期望或合并类别。
当期望极小但不为零时,应避免数值下溢或不稳定,并关注渐近卡方近似是否仍适用。
5.2 采用对数形式降低数值不稳定
实现时通常直接使用对数比结构计算 \(O_i\ln(O_i/E_i)\),而不是先求比例再取对数或进行不必要的乘方运算。这样可以减少浮点运算中的误差累积。在 \(O_i\) 与 \(E_i\) 差异较大时,对数形式更稳定。
5.3 归一化与自由度取值的常见误区
常见误区包括:
- 把“自由度”误当成表格格数或样本量的简单函数,而忽略了约束来源;
- 在自由度计算中没有采用与检验模型一致的参数估计方式(例如是否采用饱和模型或受约束模型、是否估计了某些边际量等);
- 对计数做了不恰当的归一化导致期望不再来自原假设模型。
正确做法是确保 \(E_i\) 来自与原假设一致的概率结构,并让自由度与嵌套模型的参数差保持一致。
5.4 统计软件中的等价选项与参数映射
多数统计软件提供 G 检或“似然比卡方”选项,具体命名可能不同,例如“likelihood ratio chi-square”“deviance”等。虽然输出的数值形式可能表现为 \(G\)、或差一个固定系数、或以“偏差”形式给出,但若其对应的是似然比框架,通常能通过模型定义与系数映射理解其等价性。
在使用时建议核对:软件所用的 \(E_i\) 是否为最大似然估计得到的期望、是否采用了合并类别或零处理规则,以及自由度是否与理论一致。
6 假设、前提与统计解释
6.1 原假设与替代假设的常见设定
G 检常见的原假设设定包括:类别独立、组间同分布、以及符合某个特定结构约束的概率模型。替代假设通常允许更自由的概率结构,用以获得更高(或至少不低)的对数似然。
在嵌套模型框架下,替代模型往往可以理解为“饱和模型”或“包含原假设的更一般模型”,使得对数似然差有明确意义。
6.2 大样本条件的直观含义
“大样本”意味着观测频数足够稳定,使得对数似然比统计量可以用二阶展开或渐近理论近似为卡方分布。若样本过小或类别过多导致许多单元期望计数很低,渐近近似可能偏离,进而影响 \(p\) 值的准确性。
因此,实践中通常需要对样本量、类别数以及期望计数分布做整体评估,而不是仅看单一指标。
6.3 效应量与残差(偏差/贡献度)解读
G 检统计量可以进一步分解为各单元的贡献项: \[ 2\,O_i\ln(O_i/E_i). \] 这些贡献项有助于定位“哪里偏离最大”。在许多应用中还会使用残差或贡献度的形式(例如把偏差项标准化后画图)来解释具体类别组合的偏差方向与强度。
需要注意的是,这些“贡献度”用于解释模型不匹配的局部来源,而并非直接等同于某种因果效应;其解释仍应回到统计模型与研究问题。
6.4 置信区间与模型比较的扩展思路(与似然比框架关联)
在更广义的框架中,似然比不仅用于假设检验,还可用于构造参数的置信区间或进行模型比较。对于嵌套模型,基于似然比的思想可推广为“更复杂模型是否显著改进解释能力”的判别。
当研究者关心的是模型选择而非单一检验,常会结合信息准则或其他似然相关指标来综合考虑拟合优度与模型复杂度(见扩展部分)。
7 扩展与相关概念
7.1 由似然比导出的其他统计量(概念性关联)
在广义线性模型或更一般的似然模型中,类似思想会导出与“模型与饱和模型之间的对数似然差”相关的统计量。例如,偏差(deviance)常与似然比密切相关;它可在不同模型族下以统一方式理解为“拟合不足的累积度量”。
因此,G 检可被视为在特定(常见)离散计数情形下的一个表现形式,而相关概念在更广泛模型中具有对应物。
7.2 偏差(deviance)与信息准则的联系
偏差与信息准则并非完全等同:偏差更偏向“在给定模型下的拟合差异”,而信息准则则进一步加入惩罚项以控制复杂度。两者都使用了与似然相关的核心量,但用途不同。
在实践中,偏差可用于“嵌套模型”的拟合检验;而信息准则常用于“非嵌套或多模型”比较。将两者结合时,应明确各自的目标:一个强调统计显著性检验,一个强调模型选择的折中。
7.3 “G” 的历史命名与常见称呼(科普层面)
在中文语境中,人们常把这种基于似然比的卡方检称为“G 检”。字母“G”更多是一种约定俗成的命名方式,强调它与传统皮尔逊卡方(常记作 \(X^2\))的区别:两者都在大样本下借助卡方分布近似,但目标函数与解释路径不同。
7.4 轻量梗:G 检为何“更像在听数据的心跳”
因为它不是只看“离期望有多远的平方”,而是看“观测相对期望的对数比例差”在累计——像是把每个格子的“惊讶程度”记录下来:哪里更不符合模型,贡献就更大。于是有人会用“更像在听数据的心跳”来形容它那种“细节更敏感、解释更贴近可能性”的直觉感受。
8 参考与进一步阅读(按主题列出)
8.1 概率统计教材中对似然比检验的章节
可查阅概率论与数理统计教材中“似然比检验”“嵌套模型的渐近理论”“卡方近似”等相关章节,以获得从一般似然比到 G 统计量的推导脉络与条件说明。
8.2 广义线性模型(GLM)相关的似然比/偏差统计量
GLM 教材通常把偏差(deviance)与似然比联系起来,并说明其与卡方近似及自由度的关系。阅读时可重点对照:偏差的定义与 G 检在特定分布/链接函数下的一致性。
8.3 列联表分析与卡方近似的经典资料
列联表分析的专门资料一般会系统讨论独立性检验、同质性检验与拟合检验,并比较 G 检与皮尔逊卡方检验在不同样本条件下的差异。可用来理解“为什么会看起来差不多、什么时候会差更多”。
8.4 统计软件文档与实现说明
统计软件的帮助文档常给出:G 检/似然比统计量的计算公式、零期望与零观测的处理策略、自由度计算口径,以及与皮尔逊卡方输出的对应关系。阅读这些说明有助于避免实现层面的误用。