1 概述与基本概念

1.1 分位数的含义与条件分位数

分位数是描述数据分布位置的一类统计量。例如在给定样本上,0.5 分位对应中位数,0.25 与 0.75 分别对应下、上四分位。若用条件分位数刻画“在自变量取某一条件下,因变量取到某位置的水平”,则分位数会随自变量而变化,这就得到条件分位数。

条件分位数通常记为:在自变量为 \(X=x\) 的条件下,因变量 \(Y\) 的第 \(\tau\) 分位(\(\tau\in(0,1)\))满足 \[ P(Y\le q_\tau(x)\mid X=x)=\tau. \] 当数据分布存在偏态、重尾或异方差时,条件分位数提供的刻画往往比仅用均值更贴近真实分布特征。

1.2 分位回归的目标:拟合条件分位数

分位回归的核心目标不是拟合 \(E(Y\mid X)\)(条件均值),而是直接估计一组条件分位数 \(q_\tau(x)\)。做法上通常选取若干分位水平(如 \(\tau=0.1,0.5,0.9\)),对每个 \(\tau\) 拟合一条与 \(x\) 相关的函数,使得模型在该分位意义下最优。

因此,同一个自变量集合下,不同分位对应的“效应强弱”可能不同:上尾行为可能由不同机制驱动于中间主体,这在风险、极端事件与分布非对称分析中尤为重要。

1.3 与均值回归(最小二乘)的对应关系

普通线性回归常以最小二乘为准则,等价于在误差的条件对称性与均值结构下,拟合条件均值。其损失函数可理解为平方偏差会更强调大偏差

分位回归采用以分位为中心的不对称损失:对“低于目标分位”的残差与“高于目标分位”的残差给予不同权重,从而使估计量对应到特定分位点。若取 \(\tau=0.5\),模型倾向于拟合中位数;当 \(\tau\) 改变,目标分位随之改变。

2 数学表述

2.1 线性分位回归模型

线性分位回归常写为 \[ Q_Y(\tau\mid X)=x^\top \beta_\tau, \] 其中 \(Q_Y(\tau\mid X)\) 表示 \(Y\) 在给定 \(X\) 下的第 \(\tau\) 分位,\(\beta_\tau\) 是该分位对应的参数向量。

对样本 \(\{(x_i,y_i)\}_{i=1}^n\),定义残差 \[ e_i(\beta_\tau)=y_i-x_i^\top\beta_\tau. \] 目标是对每个 \(\tau\) 求解最优 \(\beta_\tau\)。

2.2 分位损失函数(检查函数)

分位回归使用“检查函数”(check function): \[ \rho_\tau(u)=u\cdot\bigl(\tau-\mathbf{1}\{u<0\}\bigr), \] 其中 \(u\) 是残差。该函数对正负偏差施加不同斜率:当 \(u\ge 0\) 时,损失与 \(\tau u\) 成正比;当 \(u<0\) 时,损失与 \((\tau-1)u\) 成正比。由于 \(\tau\neq 0.5\) 时斜率不对称,模型会偏向于将预测调整到使“落在某一侧的概率质量”满足 \(\tau\) 的要求。

于是估计可写为 \[ \hat\beta_\tau=\arg\min_{\beta_\tau}\sum_{i=1}^n \rho_\tau\bigl(y_i-x_i^\top\beta_\tau\bigr). \]

2.3 参数估计与优化问题

由于检查函数是分段线性的,目标函数通常是凸的(对 \(\beta_\tau\) 而言),因此可将优化视为凸规划问题。该问题不依赖平方损失,也就避免了对离群值的过度惩罚倾向,因而在某些重尾或异常观测较多的情形下表现更稳健。

同时,最优解可能具有“非光滑”特征:检查函数在残差为零处不可导,但凸性仍能保证存在全局最优解(在适当条件下)。

2.4 例:从损失函数到“加权绝对偏差”

检查函数也可看作对绝对偏差的加权组合。令 \(u=y_i-x_i^\top\beta_\tau\),当 \(u\ge 0\) 时 \(\rho_\tau(u)=\tau u\);当 \(u<0\) 时 \(\rho_\tau(u)=(1-\tau)(-u)\)。因此每一项损失可写成 \[ \rho_\tau(u)= \begin{cases}

\tau\,u,& u\ge 0,\\
(1-\tau)\,u,& u<0.

\end{cases} \] 这说明分位回归等价于对“预测偏高”和“预测偏低”的绝对偏差进行不同权重的惩罚,从而对特定分位实现定向拟合。

3 计算方法与算法

3.1 线性规划视角

由于检查函数可分解为线性项,引入松弛变量后,线性分位回归可转化为线性规划(Linear Programming, LP)形式:通过将正负残差用非负变量表示,目标函数成为关于这些变量的线性表达。LP 视角的优点是凸优化结构清晰,且在数值求解上有成熟工具。

在实践中,尤其是中小规模数据或变量维度较低时,这种转化可以成为实现分位回归的直接路径。

3.2 迭代重加权最小二乘IRLS)思路

另一类常见思路是构造与检查函数相容的“加权”问题,通过迭代更新权重来逼近原目标。IRLS 的核心思想是:检查函数可看作绝对偏差的非光滑形式,利用某种平滑或近似,使其在迭代过程中对应到加权最小二乘或加权线性回归。

IRLS 的关键在于权重随残差而变:当某些观测的残差接近分界点时,权重更新会更敏感。该方法在实现上较为灵活,但需要控制数值稳定性收敛判据。

3.3 坐标下降与数值优化

在变量较多、可能包含正则化项的情形下,也可采用坐标下降(Coordinate Descent)或其他一阶/二阶数值优化策略。其基本形式是:固定除某一个参数外的其他参数,沿该参数方向求解局部最优或更新步骤,然后循环迭代。

坐标下降的优势在于对稀疏结构(如 L1 正则)或大规模特征可更友好,但对初值、步长与终止准则的选择仍会影响表现。

3.4 约束与正则化的实现(概念层面)

分位回归可与约束或正则化组合,以提升可解释性或降低过拟合风险。概念上常见的做法包括:

  • 参数约束:例如对某些系数施加上下界,或要求部分系数符号满足业务先验。
  • L1/L2 正则:L1 鼓励稀疏,适合变量筛选;L2 更强调平滑与稳定。
  • 等式/不等式约束:将优化问题扩展为带约束的凸规划或其等价形式。

这类扩展通常通过修改目标函数或引入惩罚项来实现,并利用相应优化算法求解。

4 推断与统计性质

4.1 估计量的一般理论框架

在常见的条件下,分位回归估计量可以在大样本意义下获得一致性,并满足中心极限定理所对应的渐近正态行为。其理论基础与条件分布在目标分位附近的局部性质有关,尤其是条件密度在分位点处的行为。

更直观地说,分位回归并非围绕“误差平方最小”构建理论,而是围绕“分位点所对应的概率条件”构建渐近性质,因此其标准误与置信区间计算与普通最小二乘不同。

4.2 标准误与置信区间

标准误通常通过渐近方差估计获得。实践上可能使用两类思路:一是基于目标函数的一般 M-估计/半参数框架推导;二是采用重采样方法(如自助法)来近似分位回归参数的波动。

置信区间反映的是参数估计不确定性。由于分位水平 \(\tau\) 改变,估计量的方差结构也会变化,因此不同分位的区间宽度往往不同。

4.3 假设检验与显著性评估

检验通常围绕“某些线性组合系数是否为零”展开,常见形式包括:

  • 系数显著性:检验单个或一组系数是否显著偏离零。
  • 分位差异:对同一自变量在不同分位上的系数是否不同提出检验(概念上通过联合约束或差分构造)。

在分位回归中,显著性并不直接等同于均值回归的含义:它强调在特定分位意义下的条件变化,因而需要结合分位水平来解读。

4.4 异方差与分布偏态下的适应性

若误差项呈现异方差或条件分布偏态,最小二乘估计仍可能得到一致的均值,但对尾部与分布形态的刻画会较弱。分位回归通过分别建模不同分位,能在不依赖误差方差常数或正态性的前提下提供更直接的分布层信息。

当条件分布在不同自变量取值下发生形状改变,分位回归往往比“单一均值”模型更能体现变化的方向与幅度。

5 模型诊断与评估

5.1 残差(偏差)的分位视角解读

分位回归的残差不再只是“误差大小”的通用度量,而需要结合分位点解释:在目标 \(\tau\) 下,模型期望将一部分观测更“倾向于落在预测之上或之下”,从而使检查函数意义下的偏差最小。

因此诊断时不宜仅用残差的均值或方差判断拟合质量,而应结合分位水平看残差的系统性偏移,例如是否在某些区间长期偏高或偏低。

5.2 覆盖率与分位预测检验

当模型用于区间或风险阈值时,覆盖率(例如构造的预测区间在目标概率水平下是否覆盖真实值)是一类重要评估。对分位预测,可以检查在留出样本上,真实观测落在预测分位之下的比例是否接近 \(\tau\)。

这种检验更贴近“概率一致性”的目标:如果某模型宣称给出第 \(\tau\) 分位,那么在重复抽样意义下应满足相应的经验比例。

5.3 交叉验证与评估指标选择

分位回归可在多个分位上评估。常见做法包括:

  • 交叉验证:按分位分别评估或联合评估多个 \(\tau\)。
  • 基于损失的指标:使用检查函数或其样本平均作为验证指标,越小表示在该分位意义下预测越好。
  • 相对误差类指标:在某些场景也可辅助使用,但需要注意其与分位目标的一致性。

指标选择的关键是:要与“你要拟合的分位”保持一致,否则评估可能与目标背离。

5.4 过拟合与模型复杂度控制

由于分位回归可以扩展到非线性特征、加入交互项或配合正则化,模型复杂度可能导致过拟合。控制策略包括:

  • 限制特征维度或使用筛选流程;
  • 使用正则化项(如 L1/L2);
  • 采用交叉验证选择超参数;
  • 检查不同分位下的稳定性,避免某些分位出现异常波动。

从诊断角度看,若仅某个分位显著过拟合,可能并不意味着其它分位也同样问题,因此应按分位分别观察。

6 实际应用

6.1 收入、薪酬与分布差异分析

在收入或薪酬数据中,分布通常右偏且存在长尾。均值回归可能被高收入样本拉动而掩盖中下部的规律,而分位回归能分别描述不同人群位置上的条件影响。例如教育、工龄或地区差异在中位数与上分位可能表现不同:上尾可能更受特定技能或资源配置影响。

因此,分位回归常用于解释“不同层级人群的效应差异”,使结论更具分层含义。

6.2 风险与尾部行为(如损失/极端结果)

在风险建模中,关注的往往不是平均损失,而是极端损失分位(如 0.9、0.95 或更高分位)。分位回归可直接针对这些分位建立预测关系,从而把模型目标对齐到业务关心的尾部指标。

当损失分布存在偏态、重尾或随条件变化而形状改变时,分位方法通常比依赖均值的策略更贴近“风险阈值”需求。

6.3 时间序列中的分位回归思路

时间序列中常见的难点包括依赖结构与波动聚集。分位回归可以用于建模条件分位与滞后项或外生变量的关系,例如用过去观测或可解释变量预测未来某分位水平。

在此类应用中,通常需要结合时间序列的评估方式(如滚动窗口验证)来保证推断的可用性,且需要小心自相关带来的验证偏差。

6.4 工程与环境数据的异方差建模

工程与环境观测中,测量误差或自然波动往往随条件变化而改变,表现为异方差。分位回归可以在不同条件下分别拟合更高或更低的波动水平,从而提供更全面的风险或质量控制指标。

例如在污染物浓度预测中,不仅关心平均水平,也关心较高分位对应的超标风险,分位回归适合把这种目标显式写进模型。

7 扩展与相关方法

7.1 非线性分位回归

线性分位回归假设条件分位是 \(x^\top\beta\) 的线性函数。非线性分位回归通过使用非线性特征变换(如多项式、样条基函数)或其他函数类,使得 \[ Q_Y(\tau\mid X)=f_\tau(X) \] 能够更灵活地贴合数据。

非线性扩展通常需要更严格的复杂度控制与验证,以避免在某些分位出现过拟合。

7.2 树模型/集成方法中的分位思想

在机器学习模型中,树与集成方法可以用于估计分位:通过在叶节点或分裂准则中引入分位目标,使得模型输出更接近条件分位而非均值。例如在某些框架下,树的分裂准则可能基于分位损失来优化。

这种思路的优势在于能够处理非线性关系,并能在分布层面输出不同分位的预测。

7.3 量化回归到多输出情形的扩展(概念)

当因变量不止一个、且需要对多个输出同时建模时,可以在概念上将分位回归扩展为多输出情形。常见挑战包括:不同输出的分位水平如何设置、输出之间的相关结构如何处理。

在一些实现中会分别对每个输出拟合分位模型,或采用联合建模以捕捉相互依赖,但具体方法依任务而异。

7.4 分位数处理缺失值与稳健建模(概念)

实际数据中缺失值是常见问题。分位回归的稳健性可以与缺失处理策略结合,例如:

  • 对缺失特征做合理填补或使用基于缺失机制的建模;
  • 采用对异常更稳健的估计框架;
  • 将缺失与分位目标的影响纳入验证。

概念上,关键是保证缺失处理与分位目标的一致性,避免因填补策略导致某些分位出现系统性偏差。

8 实用“坑点”与经验建议(轻度科普)

8.1 分位点选择:0.1、0.5、0.9分别在看什么

  • 0.1 分位更接近下尾或更低水平的条件结果,适合观察“表现偏低”的风险或约束情形。
  • 0.5 分位对应中位数,常用于理解整体典型水平的变化。
  • 0.9 分位关注上尾,适合研究“高水平事件”或更接近风险阈值的行为。

经验上,若目标是尾部风险,通常需要增加高分位(或低分位)的建模密度,而不是只看中位数。

8.2 样本量不足时的稳定性问题

样本不足时,尤其在极端分位(如接近 0 或 1)上,估计可能变得不稳定:参数波动更大、置信区间更宽、甚至会出现对具体观测的强依赖。经验建议是:

  • 先从中位数与中等分位开始;
  • 采用交叉验证或重采样评估稳定性;
  • 在极端分位使用更强的正则化或简化模型结构。

8.3 离群点为何不总是“越扔越好”

分位回归本身对离群点通常比最小二乘更耐受,但“耐受”不等于“无视”。如果离群点来自测量错误,可以通过数据清洗处理;但若离群点来自真实的极端情形(例如真实灾害损失),直接删除会扭曲目标分位的分布含义。

因此处理离群点时需要区分:是噪声还是信号,并用验证指标(检查损失或覆盖率)判断删与不删的影响。

8.4 模型解释:系数在不同分位上的差异如何读懂

分位回归的系数 \(\beta_\tau\) 随 \(\tau\) 改变,意味着自变量对因变量的影响在不同分布位置并不一致。读法通常是:

  • 若某自变量在高分位系数显著更大,说明它对“高水平结果”的推动更强;
  • 若在低分位接近零但在上分位明显,可能意味着它主要影响上尾风险而非整体平均水平;
  • 若不同分位符号相反,提示关系存在明显的分布型态变化。

解释时应将结论限定在对应分位语境内,并避免把某个分位的发现直接外推为“整体效应”。

9 参见与进一步阅读

9.1 与稳健回归、极值理论的联系

分位回归常与稳健统计方法同场比较:其基于检查损失的机制使其对异常观测更不敏感。另一方面,极值理论关注极端尾部的概率结构,两者在风险建模中常形成互补:分位回归提供条件分位的回归框架,而极值理论强调尾部的极端极限行为与分布形式。

9.2 与条件分布估计的关系

分位回归与条件分布估计相邻。若能估计整个条件分布,则分位可以作为该分布的函数输出;而分位回归则跳过完整分布估计,直接针对某些分位点进行回归,从而更聚焦于目标任务与计算效率。

9.3 软件实现与常用函数(概念性)

在统计与机器学习软件中,分位回归通常提供参数估计、标准误与预测接口。实现方式可能包含线性规划求解、迭代优化或与正则化结合的数值算法。用户在选用函数时通常需要指定:

  • 分位水平 \(\tau\);
  • 模型形式(线性、加入特征变换或约束);
  • 是否计算标准误与置信区间;
  • 以及交叉验证或重采样设置。