1 分层/分组方法概览
1.1 方法目标:把“可比性”拆到倾向评分尺度上
分层/分组方法是一种在观察性研究中组织比较的策略。其基本做法是先为每个样本估计“接受处理”的概率(倾向评分),再根据该概率的大小把样本划分为若干区间或组。随后在每个区间内比较处理组与对照组的结局差异,并把各区间的信息汇总,形成对处理效应的估计或检验。
该方法的目标可概括为:将“可比性”从原始协变量空间转化为倾向评分空间中的局部可比。直观地说,同一倾向评分区间内个体在“接受处理的可能性”方面更接近,因而用区间内结局差异来反映处理效应的难度降低。
1.2 与直接调整或匹配的关系
分层/分组与其他倾向评分工具同源,通常与以下思路并行:
- 与协变量回归调整的关系:回归调整直接在模型中控制混杂;分层/分组则通过分割比较来降低跨可比性差异的影响。
- 与倾向评分匹配的关系:匹配通过在倾向评分相近个体之间寻找一一或多对一对照;分层/分组不必对个体逐一配对,而是以区间为粒度进行“组内”比较。
- 与加权(如逆概率加权)的关系:加权利用权重把样本重分配到更接近目标人群的倾向评分结构;分层/分组则把权重需求转化为“区间贡献”的汇总。
在实践中,不同方法可能组合使用:例如在每个区间内仍进行回归校正,或在区间汇总时采用加权估计。
1.3 适用场景与基本假设
该策略常用于处理—对照的因果推断框架下,尤其当: 1) 存在较多协变量可用于估计倾向评分; 2) 研究者希望直观观察效应在不同相对概率人群中的变化; 3) 需要对“重叠不足”进行可视化诊断(即某些倾向评分区间中几乎全为处理组或全为对照组)。
常见基本假设包括:
- 可交换性/无未测混杂:在给定协变量后,处理分配与潜在结局独立;
- 正则性或重叠条件:在所用倾向评分区间内,对照与处理都有正的概率,使得比较有信息;
- 正确的倾向评分与区间内处理效应可识别:倾向评分模型足够反映混杂结构,且在区间内的可比性足够。
2 倾向评分区间划分
2.1 区间个数(分组数)的设定原则
区间数的选择通常体现了两难:区间太少,组内异质性大,可比性下降;区间太多,小样本导致方差膨胀,甚至出现某些区间只有处理或只有对照。
常见经验包括:
2.2 分组规则:等宽、等频与自定义断点
根据倾向评分数值的切分方式,分组规则大致分为三类:
- 等宽:在倾向评分的取值范围内按固定宽度切分。优点是直观;缺点是数据可能在某些区间稀薄。
- 等频:按倾向评分的分位点切分,使每个组大致包含相近数量的样本。这样通常能提升组内样本稳定性,但组间倾向评分范围可能不一致。
- 自定义断点:依据研究目标、理论或诊断结果选择断点。例如可结合公共支持范围,仅在支持较充分的区间内细分;或根据分布形态(如存在明显空洞)做断点。
断点策略会影响估计的偏差—方差权衡,因此通常需要在报告中说明选择理由与进行过的稳定性检查。
2.3 重叠区域与公共支持(common support)
“公共支持”指倾向评分在处理与对照样本中都有覆盖的区域。若某些倾向评分取值只在处理组出现,而在对照组几乎不出现,区间内比较就缺乏可比信息,导致估计不稳定或不可识别。
实践上,常见处理包括:
- 将不重叠的边缘区间从分析中剔除;
- 或仅在重叠范围内进行分层汇总,并明确被排除的样本比例;
- 使用图形(如倾向评分密度或分布柱状)检查重叠程度。
2.4 小样本区间与合并策略
当某些区间样本量过小,方差估计会变得不可靠,甚至无法计算区间内处理效应。可行的合并策略包括:
- 合并相邻区间:把“稀薄”的区间与相邻倾向评分区间合并,减少粒度;
- 调整分组数:降低区间个数以提升每组样本量;
- 改用更稳健的区间内估计方式:在区间内使用更稳定的回归形式或方差估计方法(需在报告中注明)。
合并会改变区间含义,因此通常需要在结果部分追溯“最终区间划分方案”。
3 分段比较的统计实现
3.1 区间内处理效应的估计方式
3.1.1 二元结局:差异、比值与回归调整
当结局为二元变量(如是否发生某事件),区间内处理效应可用多种指标表示,常见包括:
- 组间差异:在区间内计算处理组结局比例与对照组结局比例之差;
- 相对比值:用比例或比值(例如处理与对照的结局发生率比)刻画差异;
- 回归调整:在区间内进一步控制少量剩余协变量或使用带链接函数的模型,从而降低模型不设定带来的波动。
选择何种效应指标与研究的解释偏好有关,例如政策评估可能更关注风险差异,而流行病学分析可能偏好风险比或对数尺度。
3.1.2 连续结局:均值差与方差考虑
当结局为连续变量(如收入、评分),区间内估计通常以均值差为核心:
无论指标形式如何,区间内方差估计需要与所用汇总规则相匹配,以确保最终不确定性传递合理。
3.2 区间权重与汇总策略
3.2.1 直接加权平均(加权到样本或目标人群)
区间内效应估计得到后,需要汇总成总体处理效应。常见策略是对区间效应做加权平均。权重来源可以是:
- 加权到研究样本结构:例如按每个区间在样本中的占比作为权重;
- 加权到目标人群:若研究目标是估计对某类人群的效应,可将权重设为该人群在倾向评分区间中的分布;
- 使用不同加权口径比较稳健性:在同一数据上报告多种口径能帮助评估解释差异。
权重的选择影响估计所对应的“效应对象”,因此应在报告中明确是总体样本效应还是某种目标人群效应。
3.2.2 方差估计与不确定性传递
- 各区间估计的抽样波动;
- 区间之间的权重关系与可能的相关性;
- 若倾向评分模型本身需要估计(而非已知),则可能存在额外的不确定性。
常见做法包括使用解析近似或重抽样(如自助法)以捕捉整体估计过程的波动。研究者应在方法部分说明采用的方差估计方案。
3.3 效应异质性的区间解读
分层/分组的一个优势是呈现“效应随倾向评分变化”的模式。倾向评分越大,通常表示个体接受处理的相对可能性更高。因此,区间内效应随倾向评分的走势,可以被解释为:在不同相对概率群体中的处理效应差异。
需要注意的是,这种异质性解读是基于倾向评分分组的“局部比较”。区间内仍可能存在未完全消除的差异,因此对趋势的解释应保持谨慎,并结合平衡性诊断与敏感性分析。
4 诊断、敏感性与质量控制
4.1 区间内平衡性检查(协变量平衡)
在每个倾向评分区间内,最直接的质量控制是检查协变量分布是否在处理组与对照组之间更接近。常见做法包括:
- 计算区间内协变量均值/比例的差异,并给出标准化差异等指标;
- 对连续协变量使用均值差或分位数差,对离散协变量使用比例差;
- 观察平衡性是否随区间细分而改善。
如果某些区间内仍显示明显不平衡,则可能提示倾向评分模型不足以捕捉混杂结构,或该区间的公共支持不足导致比较质量下降。
4.2 倾向评分模型与区间稳定性
倾向评分本身通常来自统计模型或机器学习模型。为了保证结论可靠,常见检查包括:
- 更换倾向评分模型规格(如加入/删除变量、改变函数形式)并比较区间划分后的效应是否大体一致;
- 对区间边界做轻微调整(在可行范围内改变断点或分组数)检验稳定性;
- 检查模型拟合诊断与预测分布是否与预期一致。
稳定性良好通常能提高对结论的可信度。
4.3 处理分配不均与极端倾向评分问题
当倾向评分非常接近 0 或 1 时,意味着在相应个体中处理分配几乎“确定”。在分层/分组框架下,这会造成:
- 某些区间几乎只有处理或只有对照,导致区间内比较信息不足;
- 估计受离群或测量误差影响更大;
- 外推到重叠不足区域的解释风险上升。
因此通常需要结合公共支持评估,必要时排除不可比区间或采取更粗的分组粒度。
4.4 敏感性分析:区间划分与模型规格变更
敏感性分析用于评估结论对关键选择的鲁棒性。对分层/分组方法而言,常见敏感性变量包括:
- 分组数变化:例如从较少区间增加到更多区间,观察效应是否剧烈波动;
- 分组规则变化:等宽与等频或不同断点策略的对比;
- 倾向评分模型变更:不同协变量组合、不同函数形式或正则化/非参数方法的对比;
- 区间合并规则:对小样本区间的合并阈值变化。
若在合理范围内结论保持一致,通常意味着结果对实现细节不敏感;若高度依赖某些设定,则需在解释中更谨慎。
5 实务注意事项(报告与复现)
5.1 描述统计与区间样本量报告
可复现的关键是完整报告数据在分层/分组后的结构,包括:
- 每个区间中处理组与对照组的样本量;
- 处理率、结局均值或比例的基础描述;
- 被排除的非公共支持样本数量与原因(如有)。
这些信息有助于读者判断估计是否依赖极少数样本或边缘区间。
5.2 图表化呈现:倾向评分分布与区间效应
常见图表包括:
- 倾向评分在处理组与对照组中的分布(密度图或直方图),并标注区间断点;
- 每个区间内处理效应估计及其置信区间的点图;
- 随倾向评分区间变化的效应曲线或柱状图,便于直观观察异质性。
图表能帮助发现重叠不足、极端区间主导结果等问题。
5.3 结果汇总口径:总体效应与分层效应并存
报告通常需要区分两类信息:
- 总体效应:基于区间汇总得到的单一指标,反映对研究口径人群的平均处理效应;
- 分层效应:各区间的局部效应估计,用于展示异质性。
在写作上建议明确总体估计对应的权重口径与目标人群定义,并说明分层结果如何与总体结论相联系。
5.4 常见误区:用倾向评分“分段”替代“平衡”
一个容易被忽视的问题是把“分段”误当成“保证平衡”。分层/分组确实提升了组内可比性,但并不意味着所有协变量在每个区间都已完全对齐。典型误区包括:
- 只报告区间效应,忽略区间内平衡性检查;
- 在重叠不足区域进行过细分导致估计不稳定却不做合并或排除;
- 用过于复杂的区间划分取代对倾向评分模型质量的评估。
正确做法是将分层/分组视为“组织比较的工具”,而平衡性与重叠性诊断是质量控制的核心环节。