1 数学定义
卡方分布用于刻画“由若干个独立正态随机波动汇总得到的非负量”。在经典统计里,它最常见的来源是:若若干个独立标准正态变量平方后再求和,则其和的分布为卡方分布。
1.1 由正态变量平方和得到
1.1.1 标准正态变量的独立性条件
设 \(Z_1,\dots,Z_\nu\) 为相互独立且服从标准正态分布 \(N(0,1)\) 的随机变量。若它们独立,则平方项的联合结构能够简化为“各自平方贡献的乘积形式”,从而得到卡方分布的封闭表达。
当独立性不成立时,平方和往往不再满足简单的卡方分布形式,通常需要更复杂的模型或使用近似方法。
1.1.2 自由度参数 \(\nu\) 的含义
记 \[ X=\sum_{i=1}^{\nu} Z_i^2. \] 则 \(X\) 的分布记为 \(X\sim\chi^2(\nu)\)。参数 \(\nu\) 称为自由度,它在平方和来源的框架下可理解为“参与求和的独立正态分量的个数”。在更一般的理论表述中,\(\nu\) 也可扩展到非整数情形(见后文变体)。
1.2 概率密度与分布函数
1.2.1 概率密度函数形式
当 \(\nu>0\) 时,卡方分布的概率密度函数可写为 \[ f(x)=\frac{1}{2^{\nu/2}\Gamma(\nu/2)}x^{\nu/2-1}e^{-x/2},\quad x\ge 0, \] 其中 \(\Gamma(\cdot)\) 为伽马函数。该形式体现了:在 \(x=0\) 附近的增长或趋于无穷,取决于 \(\nu/2-1\) 的符号;而在大 \(x\) 时由指数衰减主导尾部。
1.2.2 累积分布函数(CDF)
卡方分布的累积分布函数定义为 \[ F(x)=P(X\le x),\quad x\ge 0. \] 其常用表达与不完全伽马函数相关,因此在实际计算中通常通过统计软件或数值算法获得。CDF 的数值稳定性与误差控制是分位数和尾概率计算的关键环节(见第 5 章)。
1.3 生成方式与等价表述
卡方分布不仅能由标准正态平方和得到,也能通过与更广泛的分布族建立对应关系来生成与理解。
1.3.1 与伽马分布的关系
若 \(X\sim\chi^2(\nu)\),则它与伽马分布满足等价的参数对应关系:
- 卡方分布可视为形状参数为 \(\nu/2\) 的伽马分布;
- 其“尺度/速率”取决于伽马分布的约定形式(有的用尺度,有的用速率)。
这种等价性让很多性质(如矩、尾概率的计算思路)可以直接借用伽马分布的现成结论与数值实现。
1.3.2 与指数分布的特例
当自由度 \(\nu=2\) 时,\(\chi^2(2)\) 退化为指数分布。直观上,这是“一个独立正态变量的平方”在自由度取到最简整数时的结果,因而也常被用于展示卡方分布的基本形态与尾部特征。
2 基本性质
卡方分布的性质主要体现在均值与方差的增长规律、矩的可得性、以及在自由度变化下形状如何迁移。
2.1 均值与方差
2.1.1 随自由度变化的规律
对 \(X\sim\chi^2(\nu)\),其均值与方差为 \[ \mathbb{E}[X]=\nu,\qquad \mathrm{Var}(X)=2\nu. \] 因此,\(\nu\) 同时控制了“中心位置”与“离散程度”。自由度越大,分布整体向右移动且波动也增大。
2.1.2 量纲与尺度理解
卡方分布的随机变量 \(X\) 在经典来源中是“平方和”。若原始正态变量带有方差或尺度改变,则平方和的尺度也会相应改变;这在缩放卡方分布中以参数形式体现(见第 3.2 节)。
2.2 矩与渐近行为
2.2.1 矩母函数或特征函数
卡方分布属于可用矩母函数(或特征函数)刻画的一类分布。通过它们可以得到任意阶矩的表达,或推导渐近近似所需的关键量。实践中,软件通常直接基于其与伽马分布的关系来实现计算,而不是手工展开级数。
2.2.2 大自由度近似
当 \(\nu\) 较大时,卡方分布相对更“集中”,形状会逐渐接近某种正态化后的行为。具体近似形式常见于统计推断的理论推导与误差分析中,用于简化尾概率或临界值的计算(与第 5 章的近似思路呼应)。
2.3 支持集与形状特征
2.3.1 非负性与偏态
由平方和的构造可知,卡方分布的取值必为非负: \[ X\ge 0. \] 此外,除特定自由度外通常呈右偏特征:尾部比对称分布更长,反映较大偏差在非负约束下仍有较高概率质量。
2.3.2 自由度对形状的影响
自由度 \(\nu\) 改变了峰值位置与偏度。直观上:
- 自由度小:分布更集中在靠近 0 的区域,同时右尾更明显;
- 自由度大:分布更向右移动并逐渐变得“更像钟形”(在恰当归一化后更为明显)。
3 参数与常用变体
卡方分布的核心参数是自由度 \(\nu\)。在统计实践中还常出现缩放形式以及非中心版本,用于处理偏离零均值或线性模型误差的情形。
3.1 自由度为整数与非整数
从平方和定义出发,若严格由 \(\nu\) 个独立标准正态平方和得到,则 \(\nu\) 为正整数。与此同时,卡方分布的密度表达式对任意 \(\nu>0\) 都有良好定义,因此可以将 \(\nu\) 扩展到非整数参数,仍作为同一族分布使用。这种扩展在理论推导和某些近似中很常见。
3.2 缩放卡方分布
3.2.1 与方差/尺度参数的对应
若 \(X\) 的构造来自非标准正态变量,例如 \(Y_i\sim N(0,\sigma^2)\) 且相互独立,那么 \[ \sum_{i=1}^{\nu} \left(\frac{Y_i}{\sigma}\right)^2 \sim \chi^2(\nu), \] 从而原始平方和 \[ \sum_{i=1}^{\nu} Y_i^2 = \sigma^2 X \] 服从“缩放卡方分布”,其本质差别只是整体尺度乘上 \(\sigma^2\)。这在方差推断中直接对应到卡方统计量的分母或分子尺度设置。
3.3 非中心卡方分布(概念性引入)
3.3.1 非中心参数的作用
非中心卡方分布用于刻画当正态变量的均值不为零时,平方和的分布偏离中心情形。它引入非中心参数(常记为 \(\lambda\)),反映“均值偏离 0 的程度”。非中心卡方在检验功效分析中出现较多:当原假设与实际存在偏离时,统计量的分布应由中心形式转为非中心形式(此处仅作概念性引入)。
4 统计推断中的应用
卡方分布是许多经典统计检验的分布基础。其核心用法通常是:构造某个统计量,使其在原假设成立时服从(中心)卡方分布,然后据此计算拒绝域与 p 值。
4.1 拟合优度检验
4.1.1 观察频数与期望频数
拟合优度检验用于评估“观测类别分布是否符合某个给定的概率模型”。对每一类(或分组)记观察频数为 \(O_i\),期望频数为 \(E_i\)。期望频数通常由样本量与模型概率计算得到。
4.1.2 卡方统计量的构造
在典型形式中,卡方统计量写作 \[ \chi^2=\sum_i \frac{(O_i-E_i)^2}{E_i}. \] 当样本量足够大且模型给定的概率结构与数据相匹配时,该统计量在原假设下近似服从卡方分布。
4.1.3 解释拒绝域与 p 值
确定自由度后,可将观测到的统计量值与卡方分布的尾概率对应:
- 若统计量落在拒绝域(通常是右尾较大区域),则认为偏离模型的证据较强;
- p 值表示“在原假设成立下,观测到同样或更极端统计量的概率”。
4.2 独立性检验
4.2.1 列联表与期望频数
独立性检验常见于列联表分析:将样本按两个分类变量的行列组合汇总。若假设两变量独立,则某个单元格的期望频数由行边际与列边际相乘再除以总量得到。
4.2.2 自由度的计算方法
自由度与列数、行数以及是否估计了模型参数有关。对于最常见的情形,自由度一般取到“可独立比较的单元格数减去由约束带来的自由度损失”。具体公式依列联表规模与约束来源而定。
4.3 方差相关检验
4.3.1 正态总体方差推断
当总体服从正态分布时,样本方差与总体方差之间的比值(在恰当缩放下)可与卡方分布对应。其直观原因与“正态变量平方和”的理论来源一致。
4.3.2 置信区间的构建思路
置信区间的常见做法是:把卡方分布的分位点映射到方差参数上。例如选择上下分位点对应的区间,使得在设定置信水平下覆盖率满足要求。计算本质是解不等式形式的分位点问题(见第 5 章)。
4.4 与其他检验的关系
4.4.1 与 t 检验、F 检验的联系(概念层面)
从理论链条看:
- t 检验涉及均值差与标准误的比值,背后包含标准正态及其平方和的结构;
- F 检验涉及两个平方和之比,两者分布可由卡方分布构成。
因此,t 与 F 的很多推导可视为卡方分布及其缩放/组合形式的结果。
4.4.2 何时优先使用卡方方法
当问题天然产生“平方和/偏差的非负度量”,或统计量在原假设下可近似转化为卡方分布时,卡方方法通常具有直接的解释与现成计算路径。典型场景包括拟合优度、列联表独立性以及与正态方差相关的推断。
5 计算与数值实现
卡方分布的实际使用高度依赖数值计算:需要可靠地得到 CDF、尾概率、以及分位数,进而形成 p 值和临界值。
5.1 分位数与尾概率计算
5.1.1 生成功能与软件接口
统计软件一般提供:
- \(\text{cdf}(x;\nu)\):计算 \(P(X\le x)\);
- \(\text{sf}(x;\nu)\) 或 \(1-\text{cdf}\):计算右尾概率;
- \(\text{ppf}(q;\nu)\):给定概率 \(q\) 求对应分位点。
不同软件对接口命名略有差异,但核心是围绕 CDF/尾概率/分位数三类需求。
5.1.2 精度与数值稳定性注意点
尾概率在极端右尾时可能非常小,直接用 \(1-\text{cdf}\) 可能引入灾难性消消相除误差。通常应优先使用专门的生成功能(如 survival function,或对数尾概率函数)来保持精度。分位数反解同样对数值稳定性要求较高。
5.2 手工计算思路
5.2.1 通过表格或近似估计
在不依赖软件时,常见做法是查卡方分布表获得临界值,或用插值粗略估计。由于表格通常以整数自由度或固定步长为单位,因此对非标准自由度可能需要更精细的插值策略。
5.2.2 正态近似或其他近似(高层概述)
对于较大自由度,可以采用近似把卡方分布映射到更易处理的分布形式,从而快速估算分位点或尾概率。此类近似的适用范围与误差通常需要结合自由度大小与目标尾部区域评估。
5.3 常见编程陷阱
5.3.1 自由度参数误用
一个常见错误是把样本量或类别数直接当作自由度,忽略了“由约束或参数估计带来的自由度扣减”。另一个误区是把 \(\nu/2\) 与 \(\nu\) 混淆到伽马参数的映射里,导致整体分布偏移。
5.3.2 期望频数为零或过小
在拟合优度与独立性检验中,统计量往往包含 \(\frac{(O_i-E_i)^2}{E_i}\)。若某些期望频数 \(E_i\) 为零或过小,会引发不稳定甚至不可计算的情况,并导致卡方近似不可靠。此时需回到检验适用性讨论并采取调整策略(见第 6 章)。
6 假设条件与适用性
卡方检验常以“在原假设下,统计量近似服从卡方分布”为基础。其适用性依赖于独立性与期望频数等条件。
6.1 典型前提:独立性与近似充分性
最常见的假设包括:
- 观测单位之间的独立性(或可视为独立);
- 期望频数在各类别上不应过小,使得基于渐近近似的结论成立;
- 模型的结构设置正确(如期望频数由正确的概率模型计算)。
6.2 样本量与期望频数规则(经验性讨论)
许多教材会给出经验性的阈值规则,例如要求各单元格期望频数不太小。不同资料的具体阈值可能略有差异,但共同目标是确保卡方近似足够好,从而使检验的错误率控制在可接受范围。
6.3 违反假设时的后果与替代方案
6.3.1 合并类别的思路
当某些类别的期望频数过小,可以考虑合并相邻或可合并的类别,使期望频数升高,从而改善近似质量。合并后自由度通常会改变,因此需要重新计算自由度并重算统计量。
6.3.2 其他检验的选择(概念性)
在更小样本或期望频数很不均衡时,可能需要采用更适合的小样本精确方法或重采样类方法。选择取决于数据结构与计算可行性;核心是避免在近似不成立时强行使用卡方临界值。
7 直觉理解与“卡方梗”
7.1 为什么是“平方和”的直觉
平方让偏差都变成非负,并且对较大的偏差赋予更高权重。若把“偏离模型的程度”理解为每个分量上的差异,那么平方和就是把这些偏差汇总为一个总体强度指标。卡方分布正是这种强度在正态噪声与独立结构下的分布结果。
7.2 自由度“越多越像正态”的直观说法
直观上,自由度增加意味着累加了更多相互独立的噪声来源。累加往往会使总体波动形状更接近常见的钟形轮廓(在合适标准化下尤其明显)。因此很多人会用“自由度越多越像正态”来帮助记忆,而在实际判断时仍需回到具体近似的适用范围。
7.3 常见误区的轻松提醒(如“卡方不等于卡方检验”)
“卡方分布”是一个概率模型;“卡方检验”是一类使用卡方分布来近似统计量分布、从而进行推断的具体检验流程。两者有关联但不等价:把两者混为一谈,容易在自由度选择、假设条件、以及计算细节上出错。用一句“别把分布当流程、也别把流程当分布”来记,往往能减少常见踩坑。