1 基本概念

1.1 定义

组内平方和是用来衡量同一组观测值围绕该组均值分散程度的统计量。它关注的是各组内部的波动,而不是不同组均值之间的差异。在方差分析中,组内平方和通常被视为误差变异的一部分,用于描述样本在组内的随机起伏。

1.2 数学表达式

组内平方和通常记作 SSE、SSW 或 SSwithin,具体符号因教材和软件而异。其核心思想是将每个观测值与所属组均值之间的偏差平方后加总。

1.2.1 按组计算的形式

共有若干组,第 \(i\) 组有 \(n_i\) 个观测值,组均值为 \(\bar{x}_i\),则该组的组内平方和可写为: \[ SS_{W,i}=\sum_{j=1}^{n_i}(x_{ij}-\bar{x}_i)^2 \] 全部组的组内平方和为各组组内平方和之和: \[ SS_W=\sum_i \sum_{j=1}^{n_i}(x_{ij}-\bar{x}_i)^2 \]

1.2.2 按观测值展开的形式

从单个观测值出发,组内平方和也可表示为所有观测值与其组均值偏差平方的总和。这个写法更便于直接从原始数据计算,也更容易看出每个样本对总变异的贡献。

1.3 统计意义

组内平方和反映的是同组样本围绕组均值的离散程度。数值较大时,说明组内个体差异较明显;数值较小时,说明同组数据更集中,组内波动较弱。在比较多个组时,它常被用来表征“未被组别解释的变异”。

1.4 与组内变异的关系

组内平方和与组内变异几乎可以视为同一概念在不同语境下的表达。前者强调“平方和”这一计算形式,后者强调“离散程度”的统计含义。严格说,组内平方和是变异的累积量,而组内变异则是对这种累积波动的概括性描述。

2 计算方法

2.1 单因素情形下的计算

在单因素方差分析中,计算组内平方和通常先按组整理数据,再分别求各组内偏差平方和,最后求和得到总组内平方和。

2.1.1 先求组均值再求偏差平方和

这是最直观的方法。先计算每组均值,再将组内每个观测值减去本组均值,得到偏差后平方并累加。该方法步骤清晰,便于人工核对。

2.1.2 直接利用原始数据计算

当数据量较大时,可直接使用公式对原始数据进行运算。许多统计软件会自动完成分组、求均值和平方和累加,减少手工计算误差。

2.2 多组数据的汇总计算

对于多个组别,只需分别计算每组的组内平方和,再将各组结果相加即可。若各组样本量不一致,这种汇总方式仍然成立,因为每个观测值都只与所属组均值比较。

2.3 计算中的常见步骤

2.3.1 数据分组

首先按研究设计或分类变量将样本分到不同组中。分组是否合理,直接决定组内平方和能否准确反映组内离散。

2.3.2 组均值求解

随后计算每组的平均水平。组均值是组内平方和计算的参照点,也是组内偏差的基准。

2.3.3 偏差平方累加

最后计算每个观测值相对组均值的偏差平方,并在组内及组间逐层累加,得到总的组内平方和。

3 与相关平方和的关系

3.1 与组间平方和的区别

组间平方和描述的是不同组均值之间的差异,关注“组与组之间是否不同”;组内平方和则描述组内样本的分散情况,关注“同组内部是否稳定”。二者分别对应不同来源的变异。

3.2 与总平方和的关系

总平方和衡量全部观测值相对于总均值的整体离散程度。它可以分解为组间平方和与组内平方和两部分,前者解释组别带来的差异,后者反映组内随机波动。

3.3 平方和分解恒等式

在常见的方差分析框架中,有: \[ SS_T = SS_B + SS_W \] 其中 \(SS_T\) 为总平方和,\(SS_B\) 为组间平方和,\(SS_W\) 为组内平方和。该恒等式是方差分析的基础,说明总变异可以拆分为不同来源。

3.4 在误差分解中的位置

组内平方和常被视为误差项对应的平方和部分。它并不直接体现处理效应,而是刻画无法由组别差异解释的剩余波动,因此在模型分解中占据“残差”位置。

4 在方差分析中的应用

4.1 单因素方差分析

在单因素方差分析中,组内平方和是构造F检验的重要组成部分。它用于估计组内误差波动,并与组间变异进行比较。

4.1.1 误差项的来源

组内平方和来源于各组内部个体差异、测量误差以及其他未纳入模型的随机因素。它表示在同一处理条件下,样本表现仍然存在的自然波动。

4.1.2 F统计量中的作用

F统计量通常由组间均方与组内均方之比构成。组内平方和先除以相应自由度得到组内均方,再作为分母参与F检验,从而判断组均值差异是否显著。

4.2 多因素方差分析

在多因素方差分析中,组内平方和仍然用于刻画残差变异。它配合主效应、交互效应等部分共同完成变异分解,帮助判断不同因素及其组合对结果变量的影响。

4.3 重复测量设计中的对应概念

在重复测量设计中,类似的概念通常用于描述同一对象在不同时间点或条件下的内部波动。虽然具体分解方式更复杂,但“组内”或“个体内”变异仍是重要组成部分。

4.4 模型检验中的解释

组内平方和越大,往往意味着模型未能解释的波动较多;若组内平方和较小,则说明数据更集中,模型对观测值的拟合通常更稳定。不过,是否“更好”还要结合样本量、自由度和研究目标综合判断

5 自由度与均方

5.1 组内平方和的自由度

组内平方和对应的自由度通常等于总样本量减去组数,即: \[ df_W = N-k \] 其中 \(N\) 为总观测数,\(k\) 为组数。其含义是:在每组均值已经被估计之后,剩余可自由变化的信息量减少了。

5.2 组内均方

组内平方和除以其自由度后得到组内均方: \[ MS_W = \frac{SS_W}{df_W} \] 它是对组内随机误差方差的常用估计量。

5.2.1 作为误差方差估计

在许多线性模型中,组内均方可作为总体误差方差的近似估计。若模型假设成立,它能较好反映数据中随机扰动的大小。

5.2.2 在显著性检验中的用途

组内均方常被用作检验统计量的分母或误差基准。无论是方差分析还是一些回归比较,它都承担着“背景噪声”估计的角色。

5.3 与样本量的关系

样本量越大,组内平方和往往越容易累积出较大的绝对值,因此比较不同研究或不同模型时,常需要结合均方或标准化指标来判断。单纯比较平方和大小,容易受样本规模影响。

6 性质与解释

6.1 非负性

由于组内平方和由平方项累加而成,因此它必然非负。只有当每个组内所有观测值都恰好等于组均值时,组内平方和才会等于零。

6.2 对离群值的敏感性

平方运算会放大偏离较大的观测值,因此组内平方和对离群值较敏感。少数极端值可能显著抬高结果,使组内离散程度看起来更大。

6.3 对数据尺度的影响

如果原始数据采用不同计量单位,组内平方和的数值也会随尺度变化而变化。变量经过放大后,平方和会按更高次方的比例增加,因此跨尺度比较时需谨慎。

6.4 组内离散程度的直观解释

从直观上看,组内平方和可以理解为样本围绕本组“中心点”摆动的总幅度。它越大,说明点云越分散;越小,则说明点更贴近组均值,分布更紧凑。

7 相关概念比较

7.1 方差

方差是平方偏差的平均水平,属于标准化后的离散指标;组内平方和则是平方偏差的总量。两者都描述变异,但方差更适合跨样本比较,平方和更适合分解与建模。

7.2 标准差

标准差是方差开平方后的结果,单位与原变量一致,便于直观理解。组内平方和没有回到原始单位,因此更偏向于计算和推导层面的工具。

7.3 残差平方和

残差平方和与组内平方和在很多场景下非常接近,尤其在回归或一般线性模型中,都表示观测值与拟合值之间的偏差平方和。在单因素方差分析里,组内平方和通常可视作残差平方和的对应形式。

7.4 误差平方和

误差平方和强调模型未解释部分的总变异,与组内平方和在方差分析语境中经常互通使用。不同教材可能采用不同术语,但核心含义都是“无法由组别解释的那部分波动”。

8 计算示例

8.1 简单数据示例

设有两组数据:

A组:2,4,6 B组:3,5,7

A组均值为 4,B组均值为 5。 A组组内平方和为: \[ (2-4)^2+(4-4)^2+(6-4)^2=4+0+4=8 \] B组组内平方和为: \[ (3-5)^2+(5-5)^2+(7-5)^2=4+0+4=8 \] 总组内平方和为 16。

8.2 分组数据示例

若三组样本分别为:

  • 第1组:1,2,3
  • 第2组:4,6,8
  • 第3组:5,5,5

则先分别求组均值,再计算每组内偏差平方和。第三组由于所有值都等于组均值,因此其组内平方和为 0。

8.3 手工计算过程

手工计算时,一般按以下顺序进行:

  1. 列出每组数据;
  2. 求每组均值;
  3. 计算各观测值减去组均值的偏差;
  4. 将偏差平方;
  5. 分组加总,再汇总为总组内平方和。

这一过程的关键是保持分组准确,并避免把总均值误当作组均值。

8.4 软件输出示例

在统计软件中,组内平方和通常会出现在方差分析表中,与组间平方和、总平方和、自由度和均方并列显示。软件往往直接给出 SS、df、MS 和 F 值,使用者只需据此解读即可。

9 常见误区

9.1 将组内平方和与总平方和混淆

组内平方和只反映组内波动,不包含组均值之间的差异;总平方和则包含全部变异。两者用途不同,不能直接互换。

9.2 忽略组均值而直接比较原始值

组内平方和的计算基准是组均值,而不是总体均值或某个固定常数。若直接拿原始值比较,容易失去“组内”这一含义。

9.3 误解自由度的含义

自由度不是简单的样本个数,而是可独立变化的信息数量。组内平方和对应的自由度与组数有关,反映了均值估计后剩余的有效信息。

9.4 将平方和大小直接等同于模型优劣

平方和大不一定表示模型差,小也不一定代表模型好。判断模型表现时,应结合自由度、均方、F检验以及研究背景共同分析。