1 基本概念
1.1 定义
广义最小二乘(Generalized Least Squares,GLS)是一类用于线性回归模型参数估计的方法。它的核心思想是:当误差项不再满足“方差相等、互不相关”的理想条件时,不直接套用普通最小二乘,而是将误差的协方差结构纳入估计过程,从而得到更适合数据特征的参数解。
1.2 适用场景
GLS主要用于误差项存在异方差、自相关或更一般相关结构的情形。只要模型残差呈现出明显的“非球形”特征,GLS通常就比普通最小二乘更有针对性。
1.2.1 异方差问题
当不同观测值的误差方差不相等时,样本中某些点的波动会显著大于其他点。此时若仍采用普通最小二乘,估计虽然可能保持无偏,但效率往往下降。GLS可通过赋予不同观测不同权重,缓解这一问题。
1.2.2 自相关问题
在时间序列或重复测量数据中,相邻误差常常并非独立,而是彼此相关。自相关会使标准误和检验统计量受到影响。GLS通过显式描述误差之间的相关性,能够更准确地反映信息结构。
1.2.3 相关误差结构
除异方差和自相关外,误差还可能呈现更复杂的相关模式,例如分组内相关、层级相关或块状相关。GLS适合处理这类结构化扰动,前提是协方差矩阵能够被合理刻画。
1.3 与普通最小二乘的关系
GLS可视为普通最小二乘法在更一般误差结构下的推广。二者都属于线性回归中的经典估计框架,但适用条件和最优性结论并不相同。
1.3.1 相同点
两者都以线性模型为基础,目标都是估计回归系数,使拟合值尽可能接近观测值。它们也都强调模型设定、解释变量质量以及残差分析的重要性。
1.3.2 不同点
普通最小二乘默认误差球形,即协方差矩阵与单位矩阵成比例;GLS则允许误差存在异方差和相关性,并据此修正估计过程。前者更简洁,后者更贴近复杂数据。
1.4 几何解释
从几何上看,普通最小二乘是在欧几里得空间中寻找残差平方和最小的投影;而GLS相当于先对空间进行“拉伸”或“旋转”,再在变换后的度量下寻找最优投影。换言之,GLS是在考虑误差尺度差异后的加权投影。
2 数学形式
2.1 线性模型表示
一般线性模型可写为: \[ y = X\beta + \varepsilon \] 其中,\(y\) 为因变量向量,\(X\) 为设计矩阵,\(\beta\) 为待估参数向量,\(\varepsilon\) 为误差项。GLS的关键在于对 \(\varepsilon\) 的协方差结构作出更一般的假定。
2.2 协方差矩阵假设
设误差项满足 \[ E(\varepsilon)=0,\quad Var(\varepsilon)=\Sigma \] 其中 \(\Sigma\) 是误差协方差矩阵。GLS的估计质量高度依赖于 \(\Sigma\) 的设定。
2.2.1 球形误差
若 \(\Sigma=\sigma^2 I\),则误差方差相同且彼此独立,属于球形误差。这是普通最小二乘的经典前提,也是GLS退化为OLS的特殊情形。
2.2.2 非球形误差
若 \(\Sigma\) 不是单位矩阵的比例形式,则误差呈现非球形特征。此时不同观测的可靠程度不同,观测间也可能存在相关性,需要用GLS进行修正。
2.3 估计量公式
在 \(\Sigma\) 已知时,GLS估计量可写为 \[ \hat{\beta}_{GLS}=(X' \Sigma^{-1} X)^{-1}X'\Sigma^{-1}y \] 该公式表明,GLS通过 \(\Sigma^{-1}\) 对信息进行重加权,使估计更符合误差结构。
2.4 加权变换与白化处理
GLS常通过对模型进行线性变换,将原问题转化为误差方差均匀、彼此独立的新问题。这一过程常被称为白化处理。
2.4.1 预乘变换
若存在矩阵 \(P\) 使得 \(P'P=\Sigma^{-1}\),则可将模型两边同乘 \(P\),得到 \[ Py=PX\beta + P\varepsilon \] 变换后误差项的协方差接近单位矩阵,从而可用普通最小二乘求解。
2.4.2 等价最小二乘形式
GLS也可视为最小化加权残差平方和: \[ (y-X\beta)'\Sigma^{-1}(y-X\beta) \] 这说明GLS与“带权”的最小二乘在形式上密切相关,只是权重矩阵来源于误差协方差结构。
3 理论性质
3.1 无偏性
在模型正确设定、且误差期望为零的条件下,GLS估计量通常是无偏的。也就是说,重复抽样意义下,估计值的平均不会系统性偏离真实参数。
3.2 有效性
当 \(\Sigma\) 被正确指定时,GLS相较于普通最小二乘通常具有更高效率,即方差更小。这意味着在相同样本条件下,GLS更可能给出稳定的估计结果。
3.3 一致性
若样本量足够大,且协方差设定与模型条件满足相应要求,GLS估计量可保持一致性。随着样本增加,估计值会逐渐逼近真实参数。
3.4 最优线性无偏估计
GLS在广义误差结构下具有“最优线性无偏估计”的地位,是经典最优性理论的重要推广。
3.4.1 高斯—马尔可夫定理下的扩展
高斯—马尔可夫定理指出,在球形误差下,普通最小二乘是最佳线性无偏估计。将误差协方差推广到非球形后,GLS相当于在更一般条件下继承了这一最优性结论。
3.4.2 估计方差比较
与OLS相比,GLS在正确建模误差相关结构后,其估计方差通常更小。若协方差矩阵设定准确,这种优势尤其明显;反之,优势可能减弱甚至消失。
4 误差协方差结构
4.1 已知协方差矩阵
当误差协方差矩阵已知时,GLS的理论形式最为直接。实际中这一情况较少见,但它为理解方法本质提供了清晰起点。
4.2 结构化协方差模型
在许多应用中,\(\Sigma\) 并非完全未知,而是可由少量参数刻画。通过设定结构化协方差模型,可在可解释性与可计算性之间取得平衡。
4.2.1 对角型结构
对角型结构表示误差彼此不相关,但各自方差不同。它常用于异方差问题,尤其适合观测可靠程度差异明显的场景。
4.2.2 自回归结构
自回归结构常用于时间序列误差,表示当前误差与前期误差之间存在衰减相关关系。这类结构适合描述逐步延续的波动模式。
4.2.3 等相关结构
等相关结构假定同一组内各误差之间具有相同相关程度,常见于重复测量或组内相关数据。它简化了协方差建模,也便于参数估计。
4.3 协方差矩阵的正定性
协方差矩阵一般要求为对称正定或半正定,以确保方差定义合理,并使 \(\Sigma^{-1}\) 存在或可稳健处理。若矩阵不满足正定性,GLS计算可能无法稳定进行。
5 可行广义最小二乘
5.1 概念
在实际问题中,误差协方差矩阵通常未知,因此不能直接使用标准GLS。可行广义最小二乘(FGLS)通过先估计协方差,再代入GLS公式,实现近似的广义最小二乘估计。
5.2 协方差矩阵估计
FGLS的关键步骤是根据残差或辅助模型估计 \(\Sigma\)。估计方式可以来自经验方差、残差相关性分析,或基于特定结构模型的参数拟合。
5.3 两步估计流程
典型流程是:先用普通最小二乘得到初步残差,再据此估计协方差结构,最后将估计得到的协方差矩阵代入GLS公式重新求解。这种两步法实现简单,应用广泛。
5.4 迭代广义最小二乘
当协方差结构较复杂时,常采用迭代方式反复更新参数与协方差估计,直到结果稳定。该方法在实践中常用于提高精度。
5.4.1 收敛准则
迭代过程中通常观察参数变化量、目标函数变化量或协方差参数变化量。当这些变化小于预设阈值时,可视为达到收敛。
5.4.2 迭代终止条件
终止条件除收敛外,还可能包括最大迭代次数、数值不稳定或协方差矩阵失去正定性等情况。实际软件往往会设置保护机制,以避免无限循环。
6 与其他方法的关系
6.1 加权最小二乘
加权最小二乘可视为GLS的一个特例或近似形式。当误差仅表现为方差不同而无相关性时,使用观测权重的最小二乘就能达到与GLS相近的效果。
6.2 最小二乘广义化视角
从广义视角看,GLS并不是抛弃最小二乘,而是把“最小化残差平方和”扩展为“在误差协方差度量下最小化残差”。这种思路保留了线性回归的核心框架。
6.3 极大似然估计
在正态误差假设下,GLS与极大似然估计在参数解上常具有一致性。区别在于,极大似然强调概率分布整体,而GLS更专注于二阶矩结构。
6.4 贝叶斯方法中的对应形式
在贝叶斯框架下,若先验与误差结构适当设定,后验均值或后验模式可能呈现出与GLS类似的加权线性形式。两者在数学上有联系,但解释路径不同。
7 应用领域
7.1 计量经济学
在经济数据中,异方差和序列相关十分常见,GLS常用于收入、消费、投资等模型的参数估计,以改善统计推断质量。
7.2 时间序列分析
时间序列中误差往往具有持续性与滞后相关,GLS可用于趋势模型、动态回归和某些状态空间近似模型的估计。
7.3 生物统计
在临床研究、重复测量和纵向数据分析中,个体内相关性普遍存在。GLS可帮助处理受试者内部观测非独立的问题。
7.4 工程误差建模
工程测量、信号处理和控制系统中,观测误差常带有传感器差异或系统性相关。GLS有助于提高参数辨识与预测精度。
7.5 面板数据分析
面板数据同时包含个体维度和时间维度,误差结构可能兼具组内相关与异方差。GLS及其变体常用于这类数据的估计与推断。
8 计算与实现
8.1 矩阵分解方法
实际计算GLS时,常借助Cholesky分解、特征分解或QR分解等矩阵工具,将协方差矩阵转化为更易处理的形式。分解方法的选择会影响效率与稳定性。
8.2 数值稳定性
当协方差矩阵接近奇异或条件数较大时,计算结果可能不稳定。实践中常通过正则化、降维或重新参数化来缓解数值问题。
8.3 软件包实现
多数统计软件和编程环境都提供GLS或相关功能,用户可直接指定协方差结构或权重形式,完成模型拟合。
8.3.1 统计软件中的GLS
常见统计软件通常将GLS封装为线性模型扩展模块,支持异方差结构、相关结构以及重复测量数据的拟合,便于应用者快速分析。
8.3.2 编程语言中的接口
在编程语言生态中,GLS一般通过专门的统计库实现,用户可利用函数接口设定误差结构、拟合参数并提取标准误和检验结果。
9 诊断与检验
9.1 异方差检验
在建模前后,常用残差图、检验统计量或辅助回归方法识别异方差。若异方差显著,GLS往往是重要候选方案。
9.2 自相关检验
对于时间顺序数据,可使用残差自相关图或相关统计量检查误差是否存在序列相关。若检验结果显示相关性明显,则需要考虑GLS或其变体。
9.3 协方差结构拟合优度
选择何种协方差模型,通常要比较不同结构的拟合优度。常通过信息准则、残差诊断和预测表现综合判断。
9.4 模型设定检验
GLS不仅要求误差结构合理,也要求均值模型正确。若解释变量遗漏、函数形式设定失当,即便协方差处理得当,估计结果仍可能产生偏差。
10 局限性
10.1 协方差结构设定错误
GLS依赖协方差矩阵的正确建模。若结构假设与真实数据差距较大,估计效率可能下降,甚至影响推断可靠性。
10.2 样本量不足
在小样本条件下,协方差参数估计往往不稳定,FGLS尤其容易受影响。此时估计结果可能对初始值和结构设定较敏感。
10.3 计算复杂度
当模型规模较大或协方差结构复杂时,矩阵运算成本会显著上升,尤其在迭代估计中更为明显。
10.4 对模型假设的依赖
GLS的优势建立在对均值结构与误差结构的合理假设之上。一旦核心假设不成立,其理论优越性就会受到限制。