1 概述与基本概念
1.1 缺失数据机制的总体分类(MCAR、MAR、MNAR)
在统计分析中,缺失数据通常被视为“不是随机的偶然丢失”,而是遵循某种机制。常见的机制分类以缺失事件是否依赖于数据中的不同组成部分来划分:
- MCAR(完全随机缺失):缺失与任何变量的真实取值均无关。直观上,观测到与否像随机掉队。
- MAR(随机缺失):缺失只依赖于已观测到的信息,而与未观测的真实取值无关。
- MNAR(非随机缺失):缺失与未观测到的真实取值本身有关,即缺失带有“关于潜在值”的信息。
这种分类的重要性在于:不同机制对应不同的可处理程度以及不同的推断策略。
1.2 MNAR 的定义:缺失与“未观测真实值”的关联
MNAR 的核心定义是:数据是否缺失不仅与已观测变量有关,还取决于未观测部分的真实数值。设某个观测变量为 \(Y\),缺失指示为 \(R\)(例如 \(R=1\) 表示 \(Y\) 被观测到),那么在 MNAR 情形下,缺失概率会体现对 \(Y\) 的依赖,且这种依赖包含未观测部分的取值信息。
因此,即使研究者能看到所有“已观测变量”,也可能仍无法从数据本身判断缺失机理是否属于 MNAR,或 MNAR 的强度与方向是什么。
1.3 术语对照:MNAR vs 非随机缺失 vs 缺失机理(missingness mechanism)
- MNAR 是缩写,通常直接对应中文“非随机缺失”。
- 缺失机理(missingness mechanism) 指的是生成缺失模式的概率结构或规则。讨论 MNAR,本质上是在讨论缺失指示变量如何与数据的观测/未观测部分关联。
在分析中,“机制”不仅是一个标签,更是后续建模、校正与敏感性评估能否成立的前提。
2 与其他机制的关系
2.1 MCAR(完全随机缺失)为何“更容易”
在 MCAR 下,缺失与任何变量取值无关,缺失造成的样本不完整可以视为随机抽样的结果。此时,基于观测到的数据进行的估计往往不需要显式建模缺失过程,或者缺失过程对参数估计的偏倚影响较弱。
换言之,观测子样本在统计意义上仍能代表总体分布。
2.2 MAR(随机缺失)为何“条件可处理”
MAR 下的关键特点是:缺失与未观测值无关,只由已观测变量决定。研究者如果能正确建模观测到的条件分布(或采用相应的校正方法),那么对许多常见的目标参数,缺失机制可以在推断中被“适当吸收”。
因此,MAR 往往被视为现实世界中较可操作的一类机制。
2.3 MNAR 相对 MAR 的难点:不可忽略的选择偏差
MNAR 的难点在于:缺失本身携带关于未观测真实值的信息,导致观测子样本往往系统性偏离总体。若不对缺失机制进行建模或引入额外假设,直接分析观测数据可能产生选择偏差。
相较 MAR,MNAR 通常需要更强的建模假设、更多的可识别性讨论,或采用对缺失机制的敏感性评估来检验结论稳定性。
2.4 小例子:同样的缺失率,不同的机制含义不同
假设某问卷题目 \(Y\) 的缺失比例相同(例如 30% 未回答)。在 MCAR 下,这可能只是随机遗失;在 MAR 下,未回答与某个已观测变量(如年龄段、教育程度)相关;在 MNAR 下,未回答与题目本身真实答案强相关。
由于机制不同,观测到的 \(Y\) 的分布含义也不同:同样“缺失率=30%”,在统计推断上可能对应完全不同的偏倚方向与校正需求。
3 缺失机理建模框架
3.1 缺失指示变量的表示(如 R)
建模通常从缺失指示变量入手。常见设法是定义
- \(R=1\):变量 \(Y\) 被观测
- \(R=0\):变量 \(Y\) 缺失
将缺失信息编码进 \(R\),就可以把“是否被观测”与“被观测的数值”放在同一概率框架里讨论。
3.2 以参数形式刻画缺失概率:P(R|·)
在参数化建模中,缺失概率往往写为条件概率 \(P(R=1\mid \cdot)\)。
- 若该条件只包含已观测信息,则会更接近 MAR。
- 若包含未观测真实取值(或等价地包含其可推断部分),则属于 MNAR 的表述范畴。
研究者可用逻辑回归、Probit、或更复杂的层级结构来刻画这一概率。
3.3 观测值与未观测值的分解(可观测信息与潜在信息)
为了清晰讨论依赖结构,分析常把数据拆成两类:
- 观测信息:已知的 \(Y_{\text{obs}}\) 以及其他协变量 \(X\)。
- 未观测信息:缺失处的潜在真实取值 \(Y_{\text{mis}}\)。
在 MNAR 下,缺失概率通常对 \(Y_{\text{mis}}\) 发生影响。写成数学形式时,常见结构可体现为缺失指示由 \(X\) 与 \(Y_{\text{mis}}\) 共同决定。
3.4 可识别性(identification)与模型假设
MNAR 的推断经常触及“可识别性”问题:在仅有观测数据的条件下,缺失机制与结果模型之间的参数是否能够被唯一确定。
如果缺失机制完全依赖未观测值,则观测数据往往提供的信息不足,导致存在多个机制—结果组合都能解释相同的观测分布。此时,研究者需要:
这也是 MNAR 相比 MAR 更依赖外部信息或更依赖假设检验的原因。
4 估计与推断方法(面向 MNAR)
4.1 极大似然与缺失机制联合建模
一种常见思路是把“结果分布”和“缺失过程分布”联合写入似然函数,然后使用极大似然估计。 在实现上,研究者通常指定: 1) \(Y\) 的生成模型(给定协变量或其他结构); 2) \(R\) 的生成模型(缺失指示如何依赖 \(Y_{\text{obs}}\) 与 \(Y_{\text{mis}}\))。
当联合模型完成后,缺失部分常需通过积分或近似来获得可计算的似然表达。该方法的关键挑战仍在于:对 MNAR 机制的形式设定会直接影响估计结果。
4.2 贝叶斯方法:先验、后验与缺失机理
贝叶斯框架下,可以同时对结果模型参数与缺失机制参数设置先验分布。给定先验后,缺失机制不再只是“必须被观测数据直接确定”,而是会与先验信息共同约束。
在计算层面,贝叶斯常使用 MCMC 等技术,对缺失值 \(Y_{\text{mis}}\) 和相关参数进行迭代采样。其优势包括:
- 自然表达不确定性;
- 能把外部经验(先验)纳入缺失机制的合理范围;
- 便于进行后验预测与敏感性比较。
缺点通常是先验选择的影响需要被谨慎讨论。
4.3 加权与校正思路:从“选择模型”到“结果模型”
除联合建模外,还可使用加权与校正。直观上,若缺失导致观测样本代表性不足,可以通过权重放大“更可能缺失”的样本信息,或通过校正项修正观测分布与目标总体之间的差距。
这种框架常与“选择模型”(缺失过程模型)与“结果模型”(目标变量模型)的耦合相关,目标是在估计结果参数时抵消缺失带来的选择偏差。
4.4 期望最大化(EM)在 MNAR 下的应用要点
EM 算法将问题拆为:
- E 步:在当前参数估计下,计算缺失部分的期望(或其所需统计量)。
- M 步:在这些期望值下更新参数。
在 MNAR 下,缺失过程与缺失值相关,E 步所需的期望计算往往更复杂,且可能依赖更强的模型设定。实践中需要注意:
- 初值对收敛与局部最优的影响;
- 计算缺失后验时的稳定性;
- 收敛诊断与对结果敏感性的评估。
4.5 分层/混合模型中对缺失过程的处理
当数据存在异质性时,混合模型或分层模型可把不同子群的行为差异纳入结构中。例如:
- 缺失机制在不同潜在类别中具有不同强度;
- 结果模型与缺失机制可能共享某些潜在因子。
这类方法能够提高灵活性,但同样要求合理的结构设定与可识别性考虑,并可能增加计算成本。
5 敏感性分析与稳健性评估
5.1 为什么在 MNAR 下需要敏感性分析
MNAR 推断通常依赖对缺失机理的建模假设;而这些假设往往难以仅凭观测数据完全验证。敏感性分析的目的在于:
- 系统地改变关键假设(例如缺失对未观测值的依赖强度);
- 观察估计结果是否随假设变化而显著漂移;
- 若漂移不大,则增强结论可信度;若漂移较大,则需要更谨慎地解释结论。
换言之,敏感性分析把“不可验证的假设”转化为“可对比的证据结构”。
5.2 参考分布/参考点方法(reference-based approaches)的基本思想
参考分布方法通常指定一个“基准情形”(例如某个参考水平或参考分布),并允许模型在此基础上偏离。偏离的幅度由少量参数控制,从而能在合理范围内探索 MNAR 假设。
参考点可以来自:历史研究、外部数据库、或在经验上认为更合理的一组取值。该方法的优点是可操作且易于沟通,但仍需明确参考的来源与合理性。
5.3 参数扰动与缺失强度假设的比较
另一类敏感性策略是对缺失机制中的关键参数进行扰动。例如固定结果模型,只改变缺失概率中与未观测值相关的“强度参数”,比较不同强度下的结果差异。
这种做法有助于量化:结论对“缺失相关性强弱”的敏感程度,而不是只给出单一模型下的数值输出。
5.4 报告建议:如何呈现结论的“假设依赖性”
在报告时可强调:
- 采用的 MNAR 假设类型与关键参数;
- 敏感性分析使用的参数范围或参考分布选择理由;
- 主要结论在不同假设下的变化幅度与方向;
- 与 MAR/MCAR 的对比结果(如适用)。
这种呈现方式有助于读者理解结论并非完全由数据“自动决定”,而是与建模选择共同形成。
6 诊断与实践流程
6.1 如何从数据表现推测“可能不是 MAR”
虽然严格区分 MNAR 与 MAR 往往需要额外信息,但实践中仍可观察一些迹象:
- 缺失与已观测变量即便加入模型仍存在难以解释的系统性模式;
- 缺失原因与结果变量的逻辑关联较强(例如更严重的情况更可能拒绝回答或无法随访);
- 不同调查批次或不同执行方式下缺失模式变化显著,且无法完全由已观测协变量解释。
这些信号提示缺失机制可能存在对未观测值的依赖,但最终仍需与领域知识结合。
6.2 设计对照分析:MAR 假设下与 MNAR 假设下的差异
一个常用实践流程是: 1) 在 MAR 假设下进行主分析; 2) 在若干 MNAR 假设下进行替代分析; 3) 比较参数估计、置信区间/可信区间以及预测量是否发生实质变化。
若两者差异很小,可提高对结论稳健性的信心;若差异很大,则主分析结论需要更保守的解释。
6.3 采用外部信息或领域知识约束缺失机理
缺失机制往往无法完全凭数据识别,此时外部信息尤其重要。可用的信息包括:
- 研究流程对缺失的真实原因(例如某些条件下无法收集);
- 临床或业务规则(例如“严重程度更难随访”的机制);
- 先前研究的经验范围(用于设定参考分布或敏感性参数范围)。
将这些信息转化为可操作的模型约束,有助于降低假设空间的无穷可能。
6.4 质量控制:检查模型、收敛与后验诊断
不论是极大似然、EM 还是贝叶斯方法,质量控制都应包含:
- 模型拟合与残差/诊断检查;
- EM 或优化的收敛情况与对初值的稳定性;
- 贝叶斯推断中的链收敛(如有效样本量、轨迹形态)、后验预测检查;
- 对缺失机制参数的合理性评估(避免出现明显不合逻辑的参数方向)。
这些步骤有助于避免“模型形式不当或计算不稳”导致的错误结论。
7 应用场景与案例(不涉及敏感争议)
7.1 医疗数据:生理指标缺失与“症状严重程度”相关的情形(示例)
在随访或监测研究中,若症状更重的个体更难按时完成某项检测,则缺失不仅与已知协变量相关,还可能与未观测的真实严重程度有关。这类机制常被用来说明 MNAR 的可能性:观测子样本可能偏向较轻病例,从而影响疗效或风险估计。
在示例中,可把缺失指示与潜在未观测严重程度相关的参数纳入缺失机制模型,并配合敏感性分析检验结论稳定性。
7.2 调查研究:未回答与真实态度强度的关联(示例)
在问卷调查中,人们可能对某些问题更不愿作答。若“拒答”与其真实态度强度相关(例如更强烈的观点更可能不回答),则缺失机制会携带潜在信息。
此时,将缺失机制视为 MNAR 并进行替代分析,可以帮助评估“观测到的回答”是否系统性偏向较温和的分布。
7.3 经济/行为数据:退出、失访与潜在风险水平的关系(示例)
在面板研究或行为追踪中,退出或失访可能并非完全随机。例如存在更高风险水平的参与者更可能中断跟踪,导致后续观测样本更“安全”。这种情况下,缺失机制对未观测风险水平的依赖构成 MNAR 的典型解释路径。
通过联合建模或敏感性分析,可以评估对风险趋势判断的影响程度。
7.4 教育与测评:未完成作业与潜在能力的联系(示例)
在学习数据中,未完成作业或未参加测评可能与学生真实能力或理解程度有关。能力较弱的学生可能更倾向于缺失,从而造成观测样本偏向能力更高者。
把未完成视为 MNAR 并采用缺失机制建模,有助于避免把“只看到完成者”的结果误当成总体表现。
7.5 小梗式提醒:别把“看起来随机”当成“真的随机”
实践里常见一种误解是:缺失比例相近、看上去均匀,于是把它当作 MCAR。更稳妥的提醒是:缺失“看起来随机”不等于缺失机制就是随机;若缺失与潜在真实取值相关,分析就可能需要走 MNAR 路线并配合敏感性评估。
8 术语与数学要点速查
8.1 符号约定:缺失指示、观测与未观测变量
常用约定包括:
- \(R\):缺失指示变量
- \(Y_{\text{obs}}\):观测到的 \(Y\)
- \(Y_{\text{mis}}\):缺失对应的未观测真实取值
- \(X\):协变量或其他观测信息
在 MNAR 表述中,缺失机制通常以 \(P(R\mid Y_{\text{obs}},Y_{\text{mis}},X)\) 的依赖结构体现出来。
8.2 典型条件与等价表述
在机制分类讨论中,等价表述常用于强调依赖关系是否涉及未观测值。要点是:
- MCAR:缺失概率与 \(Y_{\text{obs}}\) 与 \(Y_{\text{mis}}\) 均不直接相关;
- MAR:缺失概率不依赖 \(Y_{\text{mis}}\),只依赖 \(X\) 与 \(Y_{\text{obs}}\);
- MNAR:缺失概率依赖 \(Y_{\text{mis}}\)(或其等价的潜在信息)。
在具体模型中,“依赖”可能通过函数形式(如回归系数)或潜变量结构显式体现。
8.3 与“可忽略性(ignorability)”的概念边界
“可忽略性”常用于讨论在某些条件下是否可以在推断中不显式建模缺失机制。边界大致对应:当缺失机制满足特定条件(通常与 MAR 相关,且需满足某些额外技术条件)时,缺失机制可能对目标参数的估计可忽略。
MNAR 通常不满足可忽略性,因此更需要显式建模或敏感性分析来处理缺失过程的不确定性。
8.4 常见误区:把 MNAR 当作 MAR 的替代方案
MNAR 不是“更复杂的 MAR”。它描述的是不同层次的依赖结构:MNAR 指向缺失对未观测真实取值的关联。把 MNAR 简单当作“为了拟合更好而换的模型”容易忽略:缺失机理的假设会影响结论的可识别性与敏感性,因而更应配套机制设定、可诊断性与稳健性评估。