1 概述与基本概念
1.1 分位数的定义与直观含义
分位数用于刻画随机变量取值在“分布量的相对位置”。给定分位水平 \(p\in(0,1)\),\(p\)分位数直观上表示:随机变量取值不超过该数的概率约为 \(p\)。常见例子包括中位数(\(p=0.5\))与上分位数(如 \(p=0.95\)),前者把样本与总体的“居中”联系起来,后者强调分布的右尾位置。
1.2 经验分位数的基本思想
经验分位数是把总体分位数的概念“替换”为样本可计算量。给定样本观测值 \(x_1,\dots,x_n\),将其按从小到大排序为 \(x_{(1)}\le \cdots \le x_{(n)}\)。经验分位数在给定 \(p\)后,依据某种规则从这些秩位置中选取或插值得到估计值。不同规则对应不同的“处于比例位置”的实现方式,例如:
- 将 \(p\)映射到某个秩的样本点(计数型或离散取值);
- 在相邻秩对应的样本点之间做线性插值(插值型)。
直观上,经验分位数把“概率尺度”的分位位置映射成“样本秩尺度”的位置。
1.3 经验分位数与理论分位数的关系
理论分位数由总体分布定义;经验分位数由样本定义。统计学上通常将其视为理论分位数的随机估计量:当样本量增大时,经验分位数会逐步接近真实分位数。其误差可分解为两部分的综合效果:一是有限样本导致的“随机波动”,二是取值规则(计数或插值)引入的“离散化误差”。在一定正则条件下,经验分位数的收敛速度、渐近分布以及置信区间构造都可被分析。
2 计算方法
2.1 样本排序与秩的构造
经验分位数的实现通常从秩开始。设样本排序后为 \(x_{(1)},\dots,x_{(n)}\)。对分位水平 \(p\),需要将 \(p\)转换为某个与 \(n\)相关的秩位置。常见做法是构造“目标秩” \(r\),使得当 \(p\)变化时,目标位置线性平移到样本序列上。随后用 \(r\)所在区间决定应取哪个秩对应的样本值,或在相邻秩之间进行插值。
2.2 不同经验分位数定义(计数型/插值型)
2.2.1 线性插值的常见实现
插值型经验分位数的基本思想是:把 \(p\)映射到连续秩尺度上,再把该连续位置落在相邻两个样本点之间。令目标秩为 \(r\)(可能不是整数),设
- \(k=\lfloor r\rfloor\),\(k+1\)对应相邻的两侧样本点;
- 令权重 \(t=r-k\in[0,1)\);
则经验分位数可表示为 \[ \hat q_p=(1-t)\,x_{(k)}+t\,x_{(k+1)}. \] 这种定义具有平滑变化的特点:当 \(p\)稍有改变时,估计值也会连续或近似连续变化。
2.2.2 取最近秩的离散实现
计数型或离散实现强调“选取最接近位置的样本秩”。例如把 \(p\)直接映射到整数秩 \(k\),然后令 \[ \hat q_p = x_{(k)}. \] 此时经验分位数对 \(p\)的响应是分段常数:\(p\)在某些区间内对应同一个秩,从而估计值保持不变。该方式在强调“离散经验位置”时较常用,但对小样本与极端分位水平可能带来较明显的阶梯效应。
2.3 软件实现约定与参数差异
实际使用时,不同统计软件与库可能采用不同的分位数计算约定,包括:
- \(p\)到秩位置的映射公式(是否使用 \((n+1)p\)、\(np\) 或其他偏移);
- 插值使用的权重方式;
- 边界处理(当 \(p\)靠近 0 或 1 时,是否直接取 \(x_{(1)}\) 或 \(x_{(n)}\))。
因此,同一批数据在不同软件中计算得到的经验分位数可能存在微小差异。严谨应用中通常需要注明采用的约定或复现实验所用函数的参数设置。
2.4 多重分位数的批量计算思路
当需要同时计算多个 \(p\)(例如多个风险阈值或多条分位回归目标),常见思路包括:
- 一次排序复用:先完成 \(x_{(1)}\le \cdots \le x_{(n)}\),再对每个 \(p\)执行映射与插值或取值;
- 对 \(p\)进行单调扫描:若 \(p\)列表递增,可顺序更新目标秩区间,减少重复计算;
- 对大数据采用选择算法或分位数近似:在不要求精确到每个样本点的情况下,利用分位数摘要结构降低排序成本。
在多数中小规模任务中,排序复用已足以满足效率需求。
3 统计性质
3.1 一致性与收敛概念
经验分位数作为样本估计量,常讨论其一致性:当样本量 \(n\to\infty\) 时,\(\hat q_p\) 在概率意义下(或几乎处处意义下,视条件)趋近于真实分位数 \(q_p\)。一致性反映了“样本能够越来越准确地描述分布位置”。
3.2 渐近分布与渐近正态近似
在足够常见的正则条件下,经验分位数在中心极限定理风格下具有渐近正态近似。其核心结论可概括为:\(\sqrt{n}(\hat q_p-q_p)\) 在极限意义下收敛到某个正态分布(均值为 0)。渐近方差通常与分位点处的密度(或类似的局部斜率信息)成反比:分布在该分位附近越“陡峭”(密度越大),分位估计越稳定;反之,越平坦则波动更大。
3.3 偏差来源与小样本行为
经验分位数的误差并非只有随机波动,还可能包含偏差。偏差常见来源包括:
因此,即使渐近理论显示无偏或近似无偏,实际样本量较小时仍可能观察到系统性偏移。
3.4 有密度情形下的方差/尺度刻画
若总体分布在目标分位点附近具有密度 \(f(q_p)\),则经验分位数的尺度可以用该局部密度刻画。通常可得到误差的典型大小为 \(O(n^{-1/2})\)。直观理解是:当 \(q_p\)附近的概率质量被“压缩”得更集中时,样本秩的微小波动会对应更小的数值偏移,从而方差更小。
3.5 经验分位数的单调性与秩保持性质
经验分位数的构造使其对分位水平 \(p\)具有单调性:若 \(p_1<p_2\),则在同一取值规则下通常有 \(\hat q_{p_1}\le \hat q_{p_2}\)。此外,经验分位数与秩的对应关系可被视为一种“秩保持”:当取值规则为计数型时,分位水平对应的估计值来自特定秩位置的样本点;当为插值型时,估计值则落在相邻秩点构成的区间内,从而其变化路径仍受序统计量结构约束。
4 推断与不确定度评估
4.1 构造置信区间的常见路线
4.1.1 基于渐近误差的区间估计
利用渐近正态近似,可以为 \(\hat q_p\) 构造近似置信区间。基本套路是:
由于该方法依赖局部密度估计,密度估计偏差会直接影响区间精度。
4.1.2 基于自助法(Bootstrap)的区间估计
Bootstrap通过对原始样本进行重抽样来近似经验分位数的抽样分布。具体做法通常包括:
- 对样本进行多次重抽样得到重样本;
- 对每个重样本计算经验分位数;
- 用这些重复计算的分布分位来形成置信区间(例如百分位法或偏差校正变体)。
Bootstrap对复杂分布形状或小样本更具实用性,但计算成本更高,且重抽样次数与分位水平会影响结果稳定性。
4.2 置信区间覆盖率与样本量影响
置信区间的覆盖率(真实分位数落入区间的概率)通常随样本量增加而趋近目标水平。但在以下情形中偏离可能更明显:
- 分位水平接近 0 或 1(极端尾部);
- 样本量较小;
- 分布在分位点附近不够光滑、存在近似离散结构。
因此,应用中需要结合样本规模与分位水平评估区间可靠性。
4.3 非平滑点(分布密度较低或分段常值)下的注意事项
当目标分位点附近密度较低,经验分位数对样本波动更敏感,区间会变宽,正态近似也可能变差。若分布呈现分段常值或存在“平台”,分位点可能对应区间而非单点,经验分位数的定义(计数型/插值型)会更显著地影响估计与推断结果。此时更稳妥的做法是明确使用的分位定义,并通过仿真或Bootstrap检验区间表现。
4.4 经验分位数的标准误估计
标准误刻画估计的典型不确定度。常见估计方式包括:
- 基于渐近理论与局部密度的 plug-in 估计:先估计 \(f(q_p)\) 再代入;
- 基于Bootstrap的标准误:计算重样本分位数的样本标准差;
- 在极端分位处采用更保守的重抽样或数值方法。
选择何种方式取决于数据规模、分布形状以及对计算资源的要求。
5 应用场景
5.1 描述性统计与分布形状刻画
经验分位数可用于描述数据的整体分布形状,例如通过多条分位数展示偏度、尾部厚薄或不对称程度。与均值相比,分位数对异常值更不敏感,尤其在分布含长尾或偶发极端点时,分位组更能稳定反映“典型位置”。
5.2 风险度量与尾部分析(如VaR相关思路)
在风险度量中,经常关心损失分布的尾部位置。以损失为变量时,上分位数常被用作“在给定置信水平下可能超过的阈值”。经验分位数因此成为一种数据驱动的风险阈值估计方法:先从历史数据构造经验分布,再取对应分位水平的估计值。需要注意的是,极端分位对样本量与重尾性质更敏感。
5.3 稳健统计:用分位数替代均值
稳健统计常以分位数或基于分位数的统计量替代均值,以降低对异常值的影响。例如中位数能够在很大一类情况下抵抗极端观测;进一步的分位点差(如四分位距)也可用作尺度或离散度的稳健度量。经验分位数在这些方法中提供可操作的样本估计。
5.4 异常检测与阈值设定
异常检测常把某些高/低分位作为阈值:例如将超过上分位的样本标记为潜在异常,或将落在下分位附近的样本视为极端偏离。经验分位数因其可直接从数据构造而便于实现,并且能适配不同分布形状。实践中通常需要结合业务对“异常”定义的容忍度调整分位水平。
5.5 分位数在时间序列与滚动窗口中的使用(概念层面)
在时间序列应用中,分位数常通过滚动窗口或滑动估计来刻画随时间变化的分布位置。例如对最近一段时间的数据计算经验分位数,用于动态阈值或漂移监控。概念上,这相当于在非平稳环境下用局部样本估计分布的尾部位置,从而实现更贴近当前状态的判断。
6 与相关概念的比较
6.1 与样本中位数/Order Statistic的关系
样本中位数属于经验分位数的一种特殊情况(当 \(p=0.5\) 且采用相应定义时)。更一般地,计数型经验分位数往往直接对应某个秩的样本值,而秩对应的样本点就是序统计量(order statistic)。因此,经验分位数既可看作序统计量的推广,也可看作其更一般的插值版本。
6.2 与分位数回归的联系
分位数回归以分位点为目标优化函数,直接建模条件分位数。经验分位数则是无条件情况下对分位数位置的样本估计基础。两者在思想上相通:都以“分位位置”作为建模或估计对象;差别在于分位数回归通常引入协变量并估计条件分位函数。
6.3 与经验分布函数(ECDF)的对应关系
经验分位数与经验分布函数之间存在紧密联系。ECDF把样本映射为一个阶梯型累积分布估计;经验分位数可被视为ECDF在目标概率水平 \(p\)处的“逆映射”(在阶梯结构下对应到分段常值与插值选择)。因此,不同的经验分位数定义可以理解为对“逆映射”规则的不同约定。
6.4 与核密度/参数分布拟合的差异
与核密度估计或参数分布拟合相比,经验分位数是一种非参数、直接由数据排序得到的估计,不依赖显式选择分布家族或带宽。参数拟合在模型正确时可能提供更高效率,但当模型失配时会产生系统误差;核密度在平滑层面引入额外超参数与偏差-方差权衡。经验分位数通过减少模型假设,往往在工程场景中更易稳健部署。
6.5 与分布拟合下的参数分位数估计对比
若先对数据拟合某个分布参数,再计算该分布的理论分位数,则得到的是“模型驱动”的分位估计。与之相比,经验分位数是“数据驱动”的分位估计。前者通常依赖模型形式与参数估计精度,后者则依赖样本容量与秩映射规则。在实际应用中,二者可互为补充:经验分位数用于快速基线或模型诊断,拟合分位用于进一步的平滑与外推,但需承担模型假设带来的风险。