1 残差平方和的定义
1.1 残差与预测的基本概念
在统计建模中,常见任务是用某个模型把输入 \(x\) 映射到对输出 \(y\) 的预测值 \(\hat{y}\)。对每个观测样本,真实值与预测值之间的差称为残差。通常采用 \[ e_i = y_i - \hat{y}_i \] 其中 \(e_i\) 表示第 \(i\) 个样本的残差。
残差反映模型在样本点上的偏离程度:若预测与观测越接近,残差绝对值越小。
1.2 RSS 的数学表达式
残差平方和(RSS)将所有残差先平方再求和,用于度量整体拟合误差大小。其常用形式为 \[ \text{RSS}=\sum_{i=1}^{n} e_i^2=\sum_{i=1}^{n}(y_i-\hat{y}_i)^2 \] 其中 \(n\) 为样本量。
由于残差被平方,RSS 对正负偏差都一视同仁,且会更重视较大的偏差。
1.3 与误差项、观测噪声的关系
在回归框架下,常将观测写成“真实函数加噪声”的形式。设 \[ y_i = f(x_i) + \varepsilon_i \] 若模型用 \(\hat{f}(x_i)\) 近似 \(f(x_i)\),则残差可视为噪声项与拟合偏差共同作用的结果。RSS 因而可以理解为:模型在全部样本上产生的“平方偏离总量”,其中既包含不可解释的噪声,也包含模型未能捕捉到的结构。
在常见的统计假设下(例如误差近似独立同分布且方差固定),RSS 与误差方差的估计具有直接联系,因而能用于参数估计与模型评估。
2 计算方法与实现
2.1 在普通最小二乘中的计算
普通最小二乘(OLS)旨在选择参数,使 RSS 最小。以线性回归为例,若 \[ \hat{y}_i=\mathbf{x}_i^\top \boldsymbol{\beta} \] 则 RSS 为 \[ \text{RSS}=\sum_{i=1}^{n}(y_i-\mathbf{x}_i^\top \boldsymbol{\beta})^2 \] 计算实现上通常不需要逐点手动计算再求和;实际使用时会通过向量化计算残差或通过求解线性方程得到 \(\boldsymbol{\beta}\),继而计算拟合值与 RSS。
2.2 矩阵形式:向量与投影
令 \(\mathbf{y}\in\mathbb{R}^n\) 为响应向量,\(\mathbf{X}\in\mathbb{R}^{n\times p}\) 为设计矩阵,线性预测为 \(\hat{\mathbf{y}}=\mathbf{X}\hat{\boldsymbol{\beta}}\)。残差向量为 \[ \mathbf{e}=\mathbf{y}-\hat{\mathbf{y}} \] 于是 \[ \text{RSS}=\mathbf{e}^\top \mathbf{e}=(\mathbf{y}-\hat{\mathbf{y}})^\top(\mathbf{y}-\hat{\mathbf{y}}) \] 在 OLS 中,\(\hat{\mathbf{y}}\) 等于将 \(\mathbf{y}\) 投影到由列空间张成的子空间后的结果。可写作 \[ \hat{\mathbf{y}}=\mathbf{H}\mathbf{y},\quad \mathbf{H}=\mathbf{X}(\mathbf{X}^\top\mathbf{X})^{-1}\mathbf{X}^\top \] 进一步得到 \[ \text{RSS}=\mathbf{y}^\top(\mathbf{I}-\mathbf{H})\mathbf{y} \] 该形式揭示了 RSS 与投影算子的关系,也有助于理解自由度与平方和分解。
2.3 数值计算中的常见注意事项
2.3.1 数据标准化对 RSS 的影响
RSS 与因变量的度量尺度相关。若对响应 \(y\) 做线性缩放,例如 \(y' = c y\),同时模型预测也随之缩放(\(\hat{y}'=c\hat{y}\)),则 \[ \text{RSS}'=\sum (y'-\hat{y}')^2=c^2\sum (y-\hat{y})^2=c^2\text{RSS} \] 因此,RSS 的绝对大小不可跨尺度直接比较。若需要比较不同数据预处理或不同单位下的拟合效果,通常会结合平均误差(如 MSE)、信息准则或交叉验证等更稳健的指标。
2.3.2 数值稳定性与溢出控制
RSS 由大量平方项相加构成,数值上可能受到以下因素影响:
- 当残差量级很大时,平方和易导致溢出或精度损失;
- 设计矩阵病态时,估计 \(\hat{\boldsymbol{\beta}}\) 的数值误差会放大,从而影响 RSS;
- 采用浮点运算时可通过稳定的线性代数实现(如 QR 分解、SVD)计算拟合值或残差,避免直接求逆 \((\mathbf{X}^\top\mathbf{X})^{-1}\)。
工程实现中,许多库会自动使用数值稳定的求解路径,并提供残差平方和的直接输出。
3 在统计建模中的作用
3.1 回归模型的拟合优劣度量
RSS 常被用作“模型解释误差”的汇总量:拟合得更贴近数据时,残差整体更小,RSS 也随之下降。但 RSS 受样本量与模型规模影响,因此在比较不同模型时必须考虑这些因素。
3.2 与最小二乘准则的对应关系
在 OLS 中,最小二乘准则与 RSS 的最小化完全对应:通过求解使 RSS 最小的参数,即得到 OLS 解。换言之,RSS 既是“结果指标”,也是“优化目标”。
这使得 RSS 在解释层面很直观:模型选择直接围绕平方误差展开。
3.3 与估计量方差的联系
3.3.1 平均残差平方和(MSE)的引入
为使 RSS 在不同样本量下具有可比性,常引入平均残差平方和(MSE): \[ \text{MSE}=\frac{\text{RSS}}{n} \] 在回归推断中更常见的是“除以自由度”的版本。若线性回归有 \(p\) 个参数(含截距时通常视具体设定),则自由度为 \(n-p\),对应的无偏方差估计常写为 \[ \hat{\sigma}^2=\frac{\text{RSS}}{n-p} \] 这些量把“总误差”转化为“单位自由度下的误差强度”,便于后续方差推断与置信区间计算。
3.3.2 误差方差估计的推导背景
在常见统计假设下(误差项条件独立、均值为零且方差为 \(\sigma^2\)),RSS 的分布结构与 \(\sigma^2\) 相关。于是,利用 RSS 除以适当自由度,可以得到 \(\sigma^2\) 的估计量。该过程也是回归方差检验、标准误计算与区间估计的基础。
4 与其他指标的关系
4.1 与决定系数 R² 的转换关系
决定系数 \(R^2\) 衡量模型对总变异的解释比例。在包含截距的回归中,常定义 \[ R^2 = 1-\frac{\text{RSS}}{\text{TSS}} \] 其中 TSS 为总平方和: \[ \text{TSS}=\sum_{i=1}^{n}(y_i-\bar{y})^2 \] 因此,RSS 与 \(R^2\) 在数值上呈严格的单调关系:RSS 越小,\(R^2\) 越大(在固定 TSS 的前提下)。
4.2 与对数似然、K-L 损失的关联(高斯情形)
当残差满足高斯误差假设时,平方误差与对数似然之间存在直接联系。以误差方差为 \(\sigma^2\) 的高斯模型为例,似然函数(忽略与参数无关的常数)与 \[ \sum_{i=1}^{n}\frac{(y_i-\hat{y}_i)^2}{\sigma^2} \] 成比例,即优化平方误差等价于最大化该假设下的对数似然。若进一步讨论信息准则或 K-L(Kullback–Leibler)意义上的差异,RSS(或其归一化版本)也会在目标函数中出现,反映模型对数据生成分布的匹配程度。
4.3 与 ANOVA 中的平方和分解
在方差分析(ANOVA)框架里,总平方和通常可分解为:
- 回归平方和(解释变异)
- 残差平方和(未解释变异)
在简单线性回归或更一般的线性模型中,RSS 承担“未能被模型解释的部分”的角色。借助这种分解可以形成 F 检验:比较模型解释能力与残差波动的相对规模。
4.4 与信息准则的比较框架(作为拟合项的一部分)
信息准则(如 AIC、BIC)常把“拟合优度”与“模型复杂度”结合。对高斯误差情形,RSS 往往进入准则的似然项,从而形成类似的结构:RSS 越小倾向于更好拟合,但当参数过多时会受到复杂度惩罚。
因此,在使用信息准则时,RSS 不是唯一决定因素,而是“拟合项”的核心组成之一。
5 模型比较与合理使用
5.1 仅用 RSS 的局限性:模型复杂度问题
RSS 只反映拟合到训练数据的误差总量,但当模型参数更多时,通常更容易把训练误差压低。若仅比较 RSS,可能出现“参数越多 RSS 越小但泛化能力未必更好”的情况。换言之,RSS 缺少对复杂度的约束,容易导致过拟合。
5.2 使用自由度修正:AIC/BIC、交叉验证的思路
为缓解复杂度偏差,可采用:
- 自由度修正或基于自由度的误差度量(如除以 \(n-p\) 得到方差估计);
- AIC/BIC 等在似然或 RSS 相关项上加入复杂度惩罚;
- 交叉验证:在留出部分数据上评估模型误差,更关注对未见数据的表现。
这些方法共同作用,使“更小的 RSS”不再只意味着更好,而需在统计与预测意义上成立。
5.3 诊断视角:残差规模与异常点敏感性
5.3.1 异常值导致 RSS 偏大的原因
RSS 对残差的平方非常敏感,意味着少量极端偏差会显著抬高总量。异常点可能由测量误差、数据录入问题或真实的特殊个体/样本引起。由于平方会放大较大的残差,RSS 可能因此比整体噪声水平更高,进而影响拟合与比较。
5.3.2 残差分布偏离假设的提示
在很多推断与评价方法中,会隐含对残差分布的假设(如近似对称、方差稳定等)。若残差出现系统性形态(例如随预测值增大而方差扩大、存在明显偏态或重尾),RSS 的大小虽然可能仍然不算大,但模型可能在结构上存在未捕捉的规律。通过残差图、正态性检验或异方差检验,可以对 RSS 之外的问题进行定位。
6 扩展与变体
6.1 加权残差平方和(Weighted RSS)
当不同样本的观测可靠度不同或存在异方差时,可使用加权残差平方和。若给定权重 \(w_i\),常见形式为 \[ \text{WRSS}=\sum_{i=1}^{n} w_i (y_i-\hat{y}_i)^2 \] 权重可用来降低噪声更大的样本影响,或强调更可信的观测。加权机制往往与广义最小二乘(GLS)的思想相连。
6.2 正则化模型中的平方误差项
在包含正则化的模型中,平方误差常作为拟合项出现,但会与惩罚项共同构成总目标。例如在岭回归(L2 正则)或带弹性网(组合惩罚)的线性模型里,优化目标可写作“RSS 相关部分 + 正则项”。这类设置通过惩罚系数控制参数规模,从而在一定程度上抵抗过拟合。
此时,RSS 不再是唯一的目标,也不再直接等同于最终的优化准则。
6.3 鲁棒回归中的替代损失(概念对比)
当数据含有明显离群点时,平方损失的放大效应可能使模型表现受损。鲁棒回归通常用替代损失函数(如基于绝对误差或更平滑的替代形式)来降低极端残差的影响。概念上,这对应把“平方误差的敏感性”替换为对异常更稳健的损失度量,从而改善拟合稳定性。