1 基本概念
1.1 定义
加权最小二乘是一种回归估计方法,其基本做法是在拟合模型时为每个观测值分配不同权重,并以加权后的残差平方和最小为目标来估计参数。它通常被视为普通最小二乘的推广形式,适用于不同观测精度不一致或误差波动不均匀的情形。
1.2 核心思想
该方法的核心在于“区别对待”不同数据点。对于更可靠、方差更小的观测,可以赋予较大权重;对于噪声更强、可信度较低的观测,则降低其影响。这样做的目的,是让估计结果更接近数据背后真实的结构关系。
1.3 与普通最小二乘的区别
普通最小二乘默认所有观测具有相同方差,因此每个残差在目标函数中的地位一致。加权最小二乘则允许各观测的重要性不同,残差平方会被权重调节。也就是说,前者强调“平均对待”,后者强调“按信息量分配影响”。
1.4 适用场景
加权最小二乘常用于存在异方差的数据分析场景,也常见于测量精度不同、抽样频数不均、样本代表性差异明显等问题中。在经济学、生物统计、工程标定和部分机器学习任务里,它都具有较高实用价值。
2 数学形式
2.1 目标函数
设观测为 \(y_i\),模型预测为 \(\hat y_i\),权重为 \(w_i\),则加权最小二乘的目标通常写为加权残差平方和: \[ \sum_{i=1}^{n} w_i (y_i-\hat y_i)^2 \] 当权重越大时,该观测偏离模型所受的惩罚越强。
2.2 矩阵表示
在线性回归中,若模型写作 \(y=X\beta+\varepsilon\),则加权最小二乘可表示为最小化 \[ (y-X\beta)^{T}W(y-X\beta) \] 其中 \(W\) 为权重矩阵,通常是对角矩阵。该表示形式便于统一推导和数值计算。
2.3 权重矩阵
权重矩阵一般采用对角形式,主对角线上的元素对应各观测权重。若不同观测之间彼此独立,非对角项通常取零。若权重被设计为误差方差的倒数,则权重矩阵还带有明确的统计含义。
2.4 参数估计公式
在线性模型且权重矩阵可逆时,参数估计量可表示为: \[ \hat\beta=(X^T W X)^{-1}X^T W y \] 这一公式与普通最小二乘的表达形式相似,只是将内积结构替换为加权内积,从而反映不同观测的影响差异。
3 理论基础
3.1 异方差问题
异方差指误差项的方差随观测水平、解释变量或样本来源而变化。此时普通最小二乘虽然在某些条件下仍可得到无偏估计,但效率会下降,标准误差也可能失真。加权最小二乘正是针对这一问题提出的改进方案。
3.2 加权机制的统计意义
权重可以理解为信息量的调节器。高权重观测意味着其信息更可靠,对最终估计贡献更大;低权重观测则被视为噪声较多,因此影响被削弱。若权重设计合理,整体估计往往更稳定。
3.3 最优线性无偏估计性质
在满足特定条件时,加权最小二乘可获得优于普通最小二乘的线性无偏估计性质。尤其当权重与误差方差结构匹配时,它能够更有效地利用样本信息,使估计方差更小。
3.4 与广义最小二乘的关系
加权最小二乘可以看作广义最小二乘的一种特殊情形。若误差协方差矩阵是对角矩阵,则广义最小二乘退化为加权最小二乘。换言之,WLS主要处理方差不等但相关性较弱或可忽略的情形。
4 权重的确定
4.1 方差倒数加权
最常见的做法是令权重与误差方差成反比,即 \(w_i \propto 1/\sigma_i^2\)。这意味着方差越小的观测越可信,权重越大。该方式具有较强的理论基础,常被视为理想权重设定。
4.2 基于观测精度的加权
在测量学或实验数据中,不同观测往往对应不同精度。精度高的样本通常分配更大权重,例如仪器误差较小的数据点会更受重视。这类权重反映的是实验条件而非纯粹的统计方差。
4.3 基于样本频数的加权
当数据来自分组统计、重复计数或抽样汇总时,样本频数常可作为权重。频数较高的组别代表更多原始信息,因此在拟合中应占据更大比例。这种方法在调查统计和分层数据处理中较为常见。
4.4 经验权重与主观权重
在实际应用中,权重有时并非严格由理论推导,而是根据经验、领域知识或业务需求设定。此类权重具有一定灵活性,但也更依赖建模者判断,因此需要结合诊断结果反复调整。
5 估计与求解
5.1 正规方程
加权最小二乘的求解可通过正规方程实现,即将目标函数对参数求导并令其为零,得到 \[ X^T W X \beta = X^T W y \] 随后解线性方程组即可获得参数估计。
5.2 迭代求解方法
当模型较复杂、权重依赖于未知量,或数据规模较大时,常采用迭代算法进行求解。例如可交替更新参数与权重,直至目标函数收敛。此类方法在非线性拟合与稳健估计中尤为常见。
5.3 数值稳定性
若权重差异过大,矩阵 \(X^T W X\) 可能出现病态,导致数值不稳定。实际计算中常通过标准化变量、限制极端权重或采用分解算法来减轻误差累积问题。
5.4 计算复杂度
WLS的计算复杂度通常与普通最小二乘同阶,但由于要处理权重矩阵,实际运算量略有增加。若权重结构简单且矩阵稀疏,则可通过优化存储和线性代数技巧提升效率。
6 统计推断
6.1 参数显著性检验
在加权回归框架下,可以对回归系数进行t检验或F检验,以判断参数是否显著不为零。检验时需要注意标准误差的计算方式应与权重设定相匹配,否则推断结果可能偏离实际。
6.2 置信区间
参数估计值的置信区间可根据估计方差构造。若权重与误差结构匹配,区间通常更具代表性;若权重设定不合理,则置信区间可能过窄或过宽,降低解释价值。
6.3 拟合优度评估
拟合优度常通过加权残差平方和、加权 \(R^2\) 或信息准则等指标进行衡量。由于不同观测的重要性不同,评价时也应采用与模型一致的加权口径,而不宜直接套用普通回归的结果。
6.4 残差分析
残差分析用于检查模型是否适合数据。对于WLS,通常观察加权残差、标准化残差以及残差分布,以判断是否仍存在系统偏差、异常点或未建模的结构。
7 模型诊断
7.1 异方差检验
在使用加权最小二乘前,往往需要判断数据是否存在异方差。常见做法包括残差图观察、相关检验或专门的异方差检验方法。若异方差特征明显,WLS通常比普通最小二乘更合适。
7.2 权重合理性检查
权重若设定失真,模型可能被错误引导,因此需要检查权重是否与误差波动、测量精度或频数信息一致。必要时可对不同权重方案进行比较,选择更稳健的结果。
7.3 杠杆值与影响点
高杠杆点或异常影响点在加权框架下仍可能改变拟合结果。由于权重会改变观测的相对作用,某些原本不显眼的数据点可能在加权后表现出更强影响,因此需要结合诊断指标综合判断。
7.4 残差图与拟合图
通过绘制残差图和拟合值图,可以直观观察模型是否存在非线性趋势、离群点或结构性偏差。对加权模型而言,图形分析尤其有助于判断权重是否削弱了高噪声样本的干扰。
8 实际应用
8.1 经济数据分析
在经济学中,不同规模企业、不同收入层级或不同时间段的数据常表现出差异化波动。加权最小二乘可用于收入回归、需求估计和价格弹性分析,以改善参数估计的稳定性。
8.2 工程与测量误差校正
工程测量中,各传感器或观测设备的精度往往不一致。WLS可以把高精度测量赋予更大权重,用于仪器校准、轨迹拟合和误差修正,从而提高结果可信度。
8.3 生物统计与医学研究
在生物统计中,不同样本可能因测量误差、个体差异或实验条件而具有不同可靠性。WLS可用于剂量反应分析、实验比较和某些流行病学模型的参数估计。
8.4 复杂调查数据处理
在调查样本中,个体被抽中的概率不一致,或各分层代表性不同,通常需要使用权重进行分析。此时WLS有助于使估计结果更接近总体结构,减少抽样设计带来的偏差。
9 扩展与相关方法
9.1 广义最小二乘
广义最小二乘处理的是更一般的误差协方差结构,不仅允许异方差,也允许误差相关。相比之下,加权最小二乘只是其中较简单、应用更广的一类情形。
9.2 加权回归
加权回归是一个更宽泛的概念,既可以指线性模型中的WLS,也可以泛指在不同损失函数或不同数据点权重下进行的回归方法。它在统计与机器学习中都有广泛应用。
9.3 稳健回归
稳健回归主要面向离群点和异常值问题,通过降低异常观测对拟合的影响来提升模型鲁棒性。WLS与稳健回归都涉及“赋权”,但前者通常依据方差或精度,后者更多依据残差大小或异常程度。
9.4 迭代加权最小二乘
迭代加权最小二乘是一类通过反复更新权重来求解模型的方法,常用于广义线性模型、稳健估计和非线性问题。它与固定权重的WLS不同,权重会随着估计过程动态变化。
10 优缺点
10.1 优点
加权最小二乘能够更好地适应异方差数据,提高估计效率,并在权重设定合理时改善参数推断质量。对于不同可靠性的数据,它提供了一种直观且实用的处理方式。
10.2 局限性
该方法的效果高度依赖权重是否正确。若权重设置错误,不但不能改善估计,反而可能引入偏差或放大误差。此外,权重过于极端时还会带来数值稳定性问题。
10.3 常见误用
常见误用包括把“看起来重要”的数据随意赋予高权重、把样本量大小与权重概念混为一谈,以及在没有异方差信号时机械使用WLS。此类做法容易导致结果解释失真。
10.4 使用注意事项
使用WLS时,应先明确权重来源,再检查其统计含义是否与数据结构一致。建模过程中宜结合残差诊断、敏感性分析和对比拟合,避免单纯依赖某一种权重方案作出结论。