1 卡方统计量的基本概念
卡方统计量(Chi-square statistic)用于衡量“观测结果”与“理论模型给出的期望结果”之间的差异程度。其核心做法是将各类别(或各分组)中的偏差,按对应的离散度尺度进行加权,再对所有类别的贡献求和。若观测数据与模型预期足够一致,则总体偏差较小;反之偏离越明显,统计量数值越大。
1.1 偏离度与加权思想
在分类型或分组计数数据中,可将数据表示为若干类别的计数。对每个类别 i,记观测频数为 \(O_i\),期望频数为 \(E_i\)。卡方统计量的典型结构是 \[ \sum_i \frac{(O_i-E_i)^2}{E_i}, \] 其中分母的 \(E_i\) 起到“按方差尺度加权”的作用:期望更大、随机波动通常也更大,偏差不至于被过度夸大;反之期望很小的类别,若出现较大相对偏差,会更容易在统计量中体现出来。这种“归一化偏差再求和”的思想使得不同类别之间的比较具有一致的量纲与尺度。
1.2 与卡方分布的联系
在一定条件下(常见表述包括样本量足够大、期望频数不太小、独立性假设成立等),卡方统计量可近似服从卡方分布。此时可以使用分布的尾概率来计算 p 值:当观测到的统计量越大,位于分布右尾的概率越小,越不支持零假设。需要强调的是,这种“卡方近似”并非在所有情况下都可靠,尤其在类别过多或期望频数偏小的情形下可能失真。
1.3 适用数据类型:计数型与分组频数
卡方统计量最常见于计数型数据,也就是把观测落在若干类别中的“频数/计数”。例如:
- 拟合优度:某样本在多个类别中的比例是否符合某个理论分布;
- 独立性:两个分类变量在列联表中是否相互独立;
- 同质性:多个组内的类别分布是否一致。
这类数据天然对应“观测频数—期望频数”的比较结构,因此卡方方法成为分类数据分析中的基础工具。
2 典型形式与公式
卡方统计量存在多种具体形式。不同形式在使用的推导路径上略有差异,但共同点都是把“偏差”转化为可比较、可检验的标量。
2.1 Pearson 卡方统计量
Pearson 卡方统计量是最经典、最常用的版本。其基本形式是 \[ X^2=\sum_i \frac{(O_i-E_i)^2}{E_i}. \] 其中 \(X^2\) 常用来表示 Pearson 型统计量。
2.1.1 拟合优度场景中的形式
拟合优度检验中,通常先确定类别集合,并由理论模型给出每个类别的期望概率 \(p_i\)。若样本量为 \(n\),则 \[ E_i=n p_i. \] 将 \(O_i\) 与 \(E_i\) 代入 Pearson 公式即可得到拟合优度卡方统计量。该检验关注的是:观测在各类别的分布是否与理论概率相符。
2.1.2 独立性检验场景中的形式
在列联表中,令行类别为 i、列类别为 j。观测频数记为 \(O_{ij}\)。在“行列独立”的零假设下,期望频数由边际合计决定: \[ E_{ij}=\frac{(\text{第 i 行合计}) (\text{第 j 列合计})}{n}. \] Pearson 卡方统计量则写作 \[ X^2=\sum_{i}\sum_{j}\frac{(O_{ij}-E_{ij})^2}{E_{ij}}. \] 它衡量的是实际列联表与“由边际推导出的独立结构”之间的差异。
2.2 似然比卡方统计量(G 检)
似然比卡方统计量(常称 G 检,记作 \(G^2\))来自对似然函数的比较。它也可以用于构建卡方近似下的检验,但其偏差度量的形式与 Pearson 不同。
在常见的离散分布情境下,\(G^2\) 的核心结构可写为与对数比值相关的和。直观上,它把“观测相对期望的偏离”转换成更接近对数似然差的度量。
2.2.1 与 Pearson 统计量的差异
两者都能在大样本下近似服从卡方分布,但它们对同一数据产生的数值可能不同。差异来源在于:Pearson 使用二次型的偏差(\((O-E)^2/E\)),而 G 检使用基于对数的偏离刻画。一般而言,两种检验在期望频数足够大时往往结论相近;当期望较小或分布较稀疏时,二者表现可能更有差别。
2.2.2 常见对照与选择原则
实践中常见做法是:
- 若研究情境与经典教材采用的条件一致,Pearson 和 G 检通常都可用;
- 若某些类别期望频数偏小,或希望对极端偏离更敏感,可考虑对照两种方法并检查稳健性;
- 在给定软件与检验选项时,应明确所采用的是哪种统计量,并同时关注近似条件是否满足。
“选择哪一种”并不存在绝对统一标准,更合理的做法是与数据结构及近似适用性相匹配。
2.3 其他扩展与变体概述
除 Pearson 与 G 检外,卡方思想还衍生出许多扩展形式,用于更复杂的约束、参数估计或模型结构检验。
2.3.1 线性对比与一般框架
当模型涉及参数估计、线性约束或更一般的对照结构时,卡方统计量常以“估计量与模型期望的差异”作为核心,并通过自由度、约束个数来刻画检验规模。此类框架强调:卡方检验并不只服务于单纯的“给定期望分布”,也可用于检验某些参数或结构是否满足指定关系。
2.3.2 近似条件与使用边界
卡方检验的关键边界在于其依赖的近似。若类别过多导致期望频数过小,或数据并不满足独立性等前提,卡方分布近似可能偏离真实抽样分布。此时通常需要:
- 合并稀疏类别;
- 使用更合适的精确检验或重抽样策略(具体取决于场景);
- 或改变建模方式(例如用更直接的计数模型)。
3 在假设检验中的应用
卡方统计量在分类数据假设检验中用途广泛,常见形式对应拟合、独立与一致性等基本问题。
3.1 拟合优度检验
拟合优度检验用于判断:观测数据的类别分布是否与某个理论分布相符合。它是把“分布偏离”直接转化为一个总体检验统计量。
3.1.1 零假设与替代假设
零假设通常为“观测分布与理论分布一致”,即各类别的真实概率等于模型给出的 \(p_i\)。替代假设则允许在某些类别上出现偏离,因此并不局限于单一方向的变化。
3.1.2 自由度的确定
自由度通常与类别数以及模型中估计或约束的参数有关。一般直觉是:类别越多,检验维度越高;若模型参数由数据估计并引入额外约束,则自由度会相应减少。具体自由度计算需要结合“类别数”和“约束/估计参数个数”来确定。
3.2 列联表独立性检验
列联表独立性检验考察两个分类变量是否相互独立。通过比较观测列联表与“由边际合计推断的独立结构”之间的差异来判断。
3.2.1 行列独立的检验思路
若变量独立,则某行在不同列上的相对比例应与总体边际一致。检验把每个单元格的偏差纳入统计量:偏差越大,说明独立性假设越难以解释当前数据结构。
3.2.2 列联表自由度
自由度在列联表情境下可由行数、列数共同确定,并且不受具体分布形式影响(在独立性框架下)。因此在实际操作中,先确认行列维数,再结合固定参数与约束情况即可得到自由度。
3.3 同质性检验
同质性检验用于比较多个组之间的类别分布是否一致。它常被视为独立性检验的“分组版本”,但关注的是“不同组内分布相同”的问题。
3.3.1 分布是否一致的检验框架
将每个组看作一个“来源”,在同一类别体系下比较各组的频数结构。如果零假设成立,则各组的类别概率相同,任何差异都应可归因于抽样波动。
3.3.2 多组比较的组织方式
多组同质性检验通常通过更高维的列联结构或把组作为一个分类变量来组织。实践中,数据整理时应保持类别定义一致,并确保每个单元格的期望频数不至于过小,以保证近似检验的有效性。
4 统计推断与实践要点
在使用卡方统计量做推断时,除了计算 p 值,还需要理解自由度、近似条件与结果解读方式。
4.1 自由度与临界值/ p 值计算
检验过程一般包含两步:先由数据计算统计量 \(X^2\) 或 \(G^2\),再依据自由度确定其卡方分布。随后可计算:
- 与临界值比较:若统计量超过阈值,则拒绝零假设;
- 或直接得到 p 值:即统计量在参考分布下大于等于当前值的概率。
由于 p 值取决于样本量、类别结构与自由度,自由度的正确设置是保证推断可比性的前提。
4.2 样本量与期望频数条件
卡方近似依赖于“期望足够大”的直观需求。期望频数过小会造成分布偏离,导致 p 值不稳定。常见处理方式包括合并相邻类别或采用替代检验策略。对于具体阈值,不同教材与软件可能给出不同经验标准,因此在报告中最好说明所采用的处理规则与软件设置。
4.3 连续性修正与替代策略
在某些二维或小样本设定下,离散分布带来的离散性效应会使卡方近似略有偏差。“连续性修正”通常是针对这种偏差的一类修正思路。若样本量较小或稀疏严重,连续性修正未必总能解决问题,此时更可靠的做法往往是使用精确检验或基于重抽样的方法进行推断。
4.4 解释偏差:效应强度与残差分析
卡方检验本质上告诉我们“差异是否足够大以至于不太可能由随机波动解释”。但它不直接等同于“差异有多大”。因此通常会进一步分析:
- 残差:看哪些类别(或单元格)出现正偏差(观测高于期望)或负偏差(观测低于期望);
- 效应强度:用量化指标描述偏离幅度,避免仅凭显著性判断问题严重程度。
残差分析能把总体结论拆解到局部,帮助理解偏离来自哪里,而不是只知道“拒绝或不拒绝”。
4.5 结果报告的常见格式规范
规范报告通常包含关键信息:统计量数值、自由度、p 值,以及所用检验类型(Pearson 或 G 检等)与处理方式(如类别合并、期望频数校验结果)。当包含残差或效应量指标时,应同时说明其计算口径。这样做有助于他人复核与比较研究结论。
5 诊断、残差与补充指标
当卡方检验给出显著结果时,进一步的诊断能提升可解释性。常用工具包括标准化残差、贡献度视角以及效应量指标。
5.1 标准化残差与(学生化)残差
残差一般以 \(O-E\) 表示,但直接残差的尺度可能随期望不同而不可比。标准化残差通过引入期望的尺度对残差进行归一化,使不同单元格之间更具可比性。学生化残差进一步考虑方差估计或类似调整,使其在解释上更接近“局部偏离的标准度量”。实践中,这些残差用于定位“哪些格子最异常”。
5.2 贡献度:哪些单元“导致”偏离
可以把每个单元格在总体统计量中的贡献视为“局部贡献度”。直观地说,某些格子贡献特别大时,卡方统计量的高低就主要由这些格子驱动。贡献度分析常与残差方向结合:是某些类别系统性高于期望,还是某些类别低于期望。
5.3 效应量的近似指标(如 Cramér’s V)
仅报告 p 值可能掩盖偏离幅度。效应量指标用于衡量差异的强弱。以 Cramér’s V 为例,它基于列联表的卡方统计量与规模参数构造,便于在不同表格维度下形成可比较的强度尺度。需要注意的是,效应量的数值解释应与具体研究语境结合,并避免把效应量当作“因果强度”。
5.4 多重比较时的注意事项
当对多个类别或多个单元做事后检验(例如在残差基础上寻找多个“异常”格子)时,容易增加发现偶然显著的概率。常见应对是:
- 预先限定关注范围;
- 或在报告中说明使用了何种控制策略(例如调整显著性门槛或采用更严格的筛选标准)。
同时也要区分“探索性描述”与“严格的统计推断”,两者的严谨程度不同。
6 常见问题与“避坑”指南
卡方检验虽然常用,但在实践中常见误区会显著影响结论质量。理解这些问题能减少错误推断。
6.1 期望频数过小怎么办
当期望频数普遍偏小或某些格子接近零时,卡方近似可能不可靠。常见处理包括:
- 合并相邻或相似类别;
- 改用更合适的检验方案或精确方法;
- 重新检查分组定义是否过度细化。
核心目标是让推断所依赖的近似条件尽可能成立。
6.2 数据分组方式如何影响检验
分组会影响类别数、边际合计以及期望频数结构,从而影响自由度与统计量。过度切分可能导致稀疏问题,过度合并又可能丢失关键信息。因此分组应基于数据含义或合理的分类逻辑,而不是为了让检验“看起来更显著”而任意调整。
6.3 为什么“显著”不等于“重要”
显著性反映的是“与零假设不相容的证据强度”,它会受到样本量影响。样本量很大时,即便偏离很小也可能出现显著结果;相反样本量较小时,即便存在较大偏离也可能不显著。因此应结合效应量、残差或贡献度来判断实际意义。
6.4 统计梗:把 χ² 当万能神药的误区
一个常见“梗”式误区是把 \(\chi^2\) 当成所有问题的通用答案:只要做分类数据就一律上卡方、只要显著就认为模型“完美被推翻”。更合理的态度是:卡方检验是工具,不是结论本身。关键要检查数据是否满足独立性与近似条件,明确检验对象到底是拟合、独立还是同质性,并在需要时加入诊断与稳健性评估。