1 概览与基本概念
1.1 DID 的定义与因果解释框架
双重差分(Difference-in-Differences, DID)是一种用于因果效应评估的计量方法,核心思想是在存在某种干预(如政策、试点、事件)时,比较处理组与对照组在干预前后结果变量的变化幅度之差。其因果解释依赖一个关键识别假设:在没有干预的情形下,处理组与对照组的结果变量会沿着相同的(或差异不系统变化的)时间趋势演化。
在模型层面,DID 通常把“共同的宏观变化”与“组别固定差异”视为可抵消因素,只保留由干预引致的额外变化。该方法在实际研究中常与事件研究形式结合,以便更细致地观察动态效应与干预前趋势。
1.2 处理组、对照组与干预时间的含义
- 处理组:受到干预影响的单位集合(例如某省份、某行业、某人群或某试点地区)。
- 对照组:未受到该干预或尚未受到干预的单位集合,通常用于刻画没有干预时结果变量会如何变化。
- 干预时间:干预发生并影响结果变量的时间点或区间。DID 的解释需要明确“干预前”和“干预后”的界定,以保证比较对象具有可比性。
需要注意的是,处理组与对照组的定义必须具有研究设计依据:若所谓“对照组”其实也在干预期间受到同类冲击,则对照信息会被污染,导致估计偏离因果含义。
1.3 DID 的“差分—差分”直观理解
DID 的名称来源于两次差分:
- 第一重差分:对每个组分别计算结果变量在干预前后之间的变化(前后之差)。
- 第二重差分:比较处理组与对照组在第一重差分意义下的变化差异(差中差)。
直观上,如果处理组在干预后相对对照组出现额外上升或下降,而这种变化无法用干预前已存在的共同趋势来解释,那么该差额就被解释为干预带来的平均因果效应(在识别假设成立时)。
2 计量模型与估计方法
2.1 经典两期、两组 DID 设定
最基础的 DID 场景是“两期、两组”,即只有干预前与干预后两个时间点,且有一组处理单位与一组对照单位。此时,DID 的效果可以用“处理组前后变化减去对照组前后变化”直接得到。
在回归框架下,常见设定包括两类指示变量:
- 表示组别(处理或对照)
- 表示时间(干预前或干预后)
并通过二者交互项来表征干预的额外变化。该交互项系数即为 DID 的核心估计量。
2.2 多期 DID 的回归表达式
当样本覆盖多个时间点时,DID 不仅要刻画干预的是否发生,还要刻画不同时间的结果变化。回归表达式通常包含:
- 个体/组别固定效应或组别指标
- 时间固定效应
- 处理状态随时间变化的交互结构
2.2.1 处理指示变量与时间指示变量
- 处理指示变量通常表示单位是否属于处理组。
- 时间指示变量表示某个具体时间期(或是否为干预后)。
在多期回归中,时间维度往往通过一组时间固定效应(用多个时间指示变量表示)来进入模型,从而允许每个时期的总体冲击不同。
2.2.2 交互项的系数含义
交互项(处理状态 × 干预后时期)所对应的系数,代表在控制了组别差异与共同时间冲击后,处理组在干预发生后的额外变化相对于对照组的差异。若采用更一般的“随时间逐期变化”的处理变量,则交互项可用于识别动态效应:干预后不同时点的系数表示相对某基准期的效果路径。
2.3 事件研究(Event Study)形式
事件研究将干预后的效应拆分为多个“相对时间”段,从而观察干预对结果变量的动态影响,也为平行趋势的检验提供更直观的依据。
2.3.1 系数按相对时间展开
将每一期表示为相对于干预发生时点的“事件时间”(例如 -2、-1、0、1、2)。在回归中通常以某个干预前期作为参照组:
- 预期系数(事件时间为负)用于检验干预前差异是否系统变化;
- 干预后系数(事件时间为非负)用于刻画效应的演化与持续性。
2.3.2 与平行趋势检验的关系
平行趋势要求:在干预前,处理组与对照组的结果差异不随时间出现系统偏离。事件研究中,若干预前期的相关系数(相对于基准期)整体上接近于零且不呈现规律性趋势,则与识别假设更一致;若显著偏离或呈现可预测的趋势形态,则提示存在不可忽略的差异性冲击或选择效应,可能削弱 DID 的因果解释。
3 识别假设:依赖平行趋势
3.1 平行趋势的数学表述(直观版)
平行趋势可理解为:在没有干预的情况下,处理组与对照组的结果变量随时间的变化规律相同。更严格的说法往往涉及反事实结果:处理组在未受干预影响时,与对照组的结果差异在时间上应保持稳定(差异不系统变化)。
在实际应用中,研究者通常无法直接观察“未干预时处理组会发生什么”,因此只能用干预前的数据间接评估趋势是否大体一致。
3.2 何谓“共同冲击”与可抵消部分
平行趋势的逻辑允许抵消以下两类因素:
- 组别固定差异:处理组与对照组在干预前可能存在水平差异,只要它们在时间上不随干预而产生新的变化结构,DID 会对其进行抵消。
- 共同的时间冲击:如果某些宏观变化影响到所有单位(例如普遍的经济景气、全国性价格波动),且这种影响对处理组与对照组是同方向同幅度的,那么其效果在“差中差”中会被消去。
DID 关注的并不是是否存在差异,而是差异是否在干预前就已经按特定方式演化。
3.3 违反平行趋势的常见来源
平行趋势可能被破坏,常见原因包括:
- 处理并非外生:处理组可能因为自身增长动力更强、政策选择更早或更贴近优势资源而先行变化。
- 对照组在同一时期受到类似冲击:例如对照地区也发生了与干预同方向的政策调整或产业事件。
- 同时发生的其他差异化变动:处理组在干预前后恰好叠加了其他改革、投资或事件,使得趋势差异来自多重因素。
- 测量与口径变化:结果变量口径在干预期附近发生变化,会造成表面趋势偏离。
这些情形都可能使事件研究前期系数呈现系统性偏差,从而削弱因果含义。
3.4 依赖平行趋势的可检验性与边界
平行趋势并不能被完全“证明”,因为关键是不可观察的反事实。但它具有一定可检验性:
- 干预前的趋势可以被观察,用于提示识别假设是否大体合理。
- 模型化与统计检验可以辅助判断前期系数是否存在显著偏离或可预测结构。
边界在于:若样本容量有限、噪声较大或干预前期只有少量观测,检验可能缺乏足够辨别力;与此同时,即使干预前看起来接近一致,仍可能存在干预前未捕捉到、干预后才显现的差异化机制。
4 平行趋势的检验与诊断
4.1 事件研究的前期系数检验
事件研究中,干预前期各系数提供了检验方向:若处理组相对对照组在干预发生前就已经出现系统性偏离(例如持续上升或持续下降),则平行趋势假设难以成立或至少需要更谨慎解释。
在报告中,研究者通常不仅给出点估计,也呈现置信区间,避免只根据显著性结论作过度简化判断。
4.2 图形化与统计化检验思路
4.2.1 预趋势的可视化检查
可视化检查强调趋势形态:
- 是否在干预前围绕零线随机波动;
- 是否存在“从某时点开始逐渐偏离”的模式;
- 是否出现明显的结构性断点。
可视化的价值在于帮助识别非线性或逐步偏离的模式,从而为进一步统计检验提供线索。
4.2.2 形式化检验与显著性风险
形式化检验常见做法包括对一组前期系数进行联合检验(例如将干预前所有事件时间的系数共同约束为零)。但需要注意:
- 多重检验导致的显著性风险;
- 样本量不足时的低检验力;
- 置信区间宽时“看似一致”的不确定性。
因此,更稳妥的做法是将图形与统计结果共同解读,而不是机械依赖单一显著性结论。
4.3 安慰剂检验(Placebo)
4.3.1 假设干预时间改移
安慰剂检验通过把“干预时间”人为提前或推后,重新估计 DID 或事件研究。若模型在不存在真实干预时仍显示显著效应,说明估计可能反映了其他时间相关因素或模型设定偏差。
关键在于:安慰剂的“虚假干预点”应该落在合理的时间位置,并重复多次以覆盖不同置换方案(视数据可用性而定)。
4.3.2 两级处理组的构造
某些情境下可以构造两级安慰剂:
- 例如把本来不处理的组当作“伪处理组”,观察是否也能得到类似效应;
- 或将原处理组按照某种规则分割为“伪处理子组”与“伪对照子组”,进行对照检验。
这种做法的目的在于评估:结果是否对“分组方式”过度敏感,或仅在正确分组下才出现。
4.4 可观测特征与组别可比性评估
平行趋势强调结果趋势,但组别可比性评估仍然重要:
- 干预发生前,处理组与对照组在可观测特征上是否差异巨大;
- 差异是否可能与未来趋势变动相关;
- 研究者是否进行了合理的匹配、加权或控制变量处理(注意控制变量的使用同样需要谨慎)。
当可观测差异在干预前已经呈现出与结果趋势一致的方向变化时,应更警惕因果解释的稳健性。
5 标准误、聚类与推断稳健性
5.1 为什么需要聚类标准误
DID 回归中常见误差相关结构:同一单位在不同时间的误差往往不独立;或同一组内观察存在共同冲击。若忽略这种相关性,标准误可能被低估,从而使显著性判断失真。
聚类标准误通过允许同一聚类单元内任意相关,来获得更可靠的推断。
5.2 不同聚类层级的选择原则
聚类层级取决于研究设计中的误差相关来源。例如:
- 若政策冲击主要按地区发生,地区层面的相关性更关键;
- 若冲击按企业发生,则企业层面的聚类更贴近真实数据生成过程。
通常需要结合干预机制与数据结构判断。实践中,研究者也会在稳健性部分报告替代聚类方案以展示结论稳健性。
5.3 两维聚类的考虑(时间与个体/组别)
在面板或重复观测中,误差可能同时在“个体维”和“时间维”相关。两维聚类或多维聚类思想旨在同时处理这两类相关性,避免在单一维度聚类下仍然遗漏相关结构。
两维聚类的实现与解释更复杂,因此更需要清楚说明聚类维度的依据,并与样本量、自由度条件相匹配。
5.4 小样本与自由度修正(概念层面)
当聚类单元数量较少时,基于渐近理论的标准误可能不够精确。自由度修正或有限样本修正方法可用于改善推断质量,但具体选取取决于软件实现与研究者对误差结构的理解。
概念上,重点是承认“显著性”在小样本时更不稳定,并在结果呈现中给出清晰的不确定性描述。
6 变体与扩展
6.1 分组 DID:多处理强度或多时点
当处理并非只有“是否受影响”这一维度,而是存在不同强度或不同开始时间,可以扩展 DID:
- 多强度处理:处理强度可作为连续或分类型变量进入模型,通过交互项识别差异化效应。
- 多时点处理:允许不同单位在不同时间开始受到干预,需要更细的相对时间处理(事件时间对齐)与定义。
此类扩展提高了适配性,但也增加了识别与实现难度。
6.2 三重差分(DDD)与异质效应的嵌入
三重差分(Difference-in-Differences-in-Differences)用于在 DID 基础上进一步比较“差异的差异”,例如:
- 不同群体(按行业或地区)对同一政策的响应是否不同;
- 干预后效应在不同特征分组间是否存在系统差异。
DDD 通常通过三重交互项实现,直接对应某类异质效应的识别。但同时也继承 DID 对平行趋势的要求,并把其扩展到更具体的维度上。
6.3 滚动窗口与子样本 DID
研究者有时采用滚动窗口,只在干预前后某段时间内估计效应,以减少长周期噪声或结构性变化的干扰。也可能基于子样本(例如仅考虑某类地区或特定时间段)进行估计,以检查结论是否由特定样本驱动。
这种做法有助于诊断稳健性,但可能牺牲外推性,因此应与研究问题匹配并在解释中保持谨慎。
6.4 合成对照 DID / 加权思想的结合(概念对接)
合成对照(Synthetic Control)强调用加权组合构造更贴近处理组的对照路径。与 DID 结合时,研究者可以通过加权思想让对照组在干预前更“像”处理组,从而缓解对平行趋势的敏感性。
这里的核心是:使对照构造更接近反事实,从而增强估计的可信度。具体实现取决于数据可得性与方法选择。
6.5 反事实框架下的替代表述(概念层面)
从反事实视角看,DID 将“处理组未受干预时的潜在结果”与“处理组实际结果”之差解释为因果效应。DID 的优势在于它把反事实的变化模式限制在某种可识别结构上:通过对照组的时间演化来补全处理组的缺失潜在结果。
不同表述方式在数学形式上可能不同,但都围绕同一因果逻辑:利用对照信息构造缺失反事实,并在平行趋势等假设下解释差异。
7 模型设定、变量与数据实践
7.1 结果变量与处理变量的选择
结果变量需要满足可观测、稳定口径与与政策机制相关的原则。处理变量(处理状态)则应明确其发生逻辑:何时开始被视为“已处理”,是否存在部分受影响或滞后效应。
当存在滞后或持续影响时,处理变量的定义与事件时间对齐方式会显著影响估计解释,研究者需要据此调整模型设定。
7.2 干预时点的识别与对齐
干预时点可能存在执行延迟、逐步落地或政策传导滞后。实践中常用做法是:
- 明确政策宣布与实际生效的时间;
- 将干预前后切分保持一致;
- 对事件研究相对时间窗口做合理选择。
对齐错误会导致把效应的一部分误归到干预前,从而扭曲平行趋势检验与动态效应估计。
7.3 处理组定义的稳健性
处理组边界可能存在争议,例如:
- 试点覆盖范围是否完全一致;
- 部分单位是否实际受到影响;
- 干预覆盖是否发生过调整。
因此,处理组定义的替代方案(如按覆盖范围阈值重定义)常用于稳健性检验,以减少“分组误设”带来的偏差。
7.4 缺失数据与样本筛选偏差
缺失数据可能在干预前后并不随机:例如政策推行后数据采集更完整,或单位退出、停产导致样本结构变化。若缺失与结果或处理状态相关,DID 估计可能产生偏差。
在实践中,应进行缺失机制评估、样本流失描述,并在需要时采用合适的样本保持或敏感性分析策略(具体做法取决于数据结构与可用方法)。
7.5 指标变量编码与可重复实现
变量编码应做到:
- 事件时间映射清晰;
- 处理状态构造可复现;
- 控制变量与固定效应包含规则透明。
尤其在多期与事件研究中,若编码方式不一致(例如基准期选择、事件时间截断规则),不同团队可能得到不同结论。良好的代码与记录能显著提升可验证性。
8 识别风险与常见误用
8.1 平行趋势被破坏但仍强行解释的风险
若事件研究前期系数呈现系统偏离,却仍将 DID 结果解释为因果效应,往往会产生“假因果”。这种误用通常源于对识别假设的重要性估计不足,或只看后期显著性而忽略前期证据。
在报告中,结论表述最好与诊断结果相匹配:当前期不支持平行趋势时,应转向更谨慎的叙述,或考虑替代策略。
8.2 组别同时发生其他干预的“混入”
当处理组在干预期间同时经历其他政策、资源投入或行业冲击,而对照组没有同类变化,则 DID 会把多重效应混在一起,导致“把别的东西算成政策效应”。辨别混入需要依赖研究设计与背景信息,而不仅是回归结果。
常见应对包括:控制已知同步政策(在不引入偏误的前提下)、限制样本到较干净的时期,或进行叙事层面的机制核对。
8.3 回归方程设定错误(如不恰当控制变量)
控制变量的加入可能带来两类问题:
- 控制了受处理影响的变量:可能引入“坏控制”(bad controls),导致估计偏差。
- 控制结构与识别逻辑冲突:例如在固定效应或时间结构下重复控制或错误设定交互,造成参数含义变化。
因此需要确保回归设定与研究问题一致,并保持解释链条清晰。
8.4 过度拟合与“把噪声当趋势”
在事件研究中,事件时间窗口过宽、参数过多,可能导致对噪声的拟合增强,形成表面上的趋势。若预期系数在统计上看起来“平滑”,但其实源于自由度不足或平滑假象,也会误导因果判断。
更稳妥的做法是合理截断事件时间、采用可解释的基准期与适当的模型复杂度控制,并与图形诊断结合。
8.5 DID 结果的外推边界(别拿本地结论当全球真理)
DID 的估计通常对应特定政策、特定时期、特定样本。外推到其他地区或其他政策形态时,识别条件可能不再成立,例如平行趋势难以维持,或政策机制在新环境中不同。
因此,结论表达应强调适用范围,避免把局部证据直接当作普遍规律。
9 结果呈现与解释规范
9.1 系数如何映射到处理效应
在两期两组 DID 中,关键系数对应平均处理效应的差中差解释。在多期或事件研究中,系数对应相对时间点的动态效应:每个时期的系数代表在控制固定效应与时间冲击后,处理组相对对照组的额外变化。
当结果变量为对数、比率或指标变量时,系数含义需要按模型形式做正确换算(例如对数模型常用于近似百分比变化解释)。
9.2 置信区间、显著性与效应规模的表达
展示不仅要给显著性标记,更应给出:
- 点估计与置信区间范围;
- 以研究单位更易理解的效应规模表达(例如绝对量或相对变化)。
对显著性不确定时,强调估计不精确而不是武断下结论,有助于避免“显著性替代理论”的偏差。
9.3 事件研究图的解读要点
解读事件研究图时常关注:
- 干预前期是否围绕零线随机波动;
- 干预后期效应是否迅速出现、是否有滞后;
- 效应是否持续或衰减;
- 置信区间是否随时间扩大导致不确定性显著增加。
避免只关注某一期的“高点显著”,而忽略整体路径形态。
9.4 异质性(按地区、行业、人群)展示方式
异质性分析常通过:
- 分组 DID 或 DDD;
- 交互项估计;
- 子样本估计
来呈现。关键是保证分组与识别逻辑一致,并在展示中说明每一类结果的解释范围。
异质性结论同样应伴随不确定性展示,避免把样本波动误读为机制差异。
9.5 结论写作中的常见表述错误
常见错误包括:
- 把相关性叙述写成强因果口吻而忽略平行趋势证据;
- 只报告显著结果并忽略前期检验与稳健性;
- 混淆“平均效应”与“动态效应”或“短期效应”;
- 过度外推到非对应样本与非对应机制情境。
较规范的写法是:明确识别假设、报告检验结果,并在结论中与证据强度匹配。
10 实施流程(从数据到结论)
10.1 研究设计与对照组选择
在估计之前首先完成研究设计:明确干预的时间安排与处理范围,并基于制度背景选择对照组。对照组选择应尽量保证其在干预前具有相近趋势,或至少在可检验层面表现出合理性。
10.2 数据预处理与变量构造
接下来进行数据清洗与变量构造:
- 统一口径、处理异常值;
- 构造处理状态与事件时间;
- 设定结果变量与控制变量;
- 记录缺失与样本进入/退出情况。
这一阶段的质量直接影响识别检验与最终估计可解释性。
10.3 估计步骤与模型检查清单
常见估计步骤包括:
- 先估计基础 DID 或固定效应回归;
- 再估计事件研究形式以观察动态路径;
- 检查关键系数是否符合预期方向与诊断结果;
- 核对固定效应与聚类标准误设置是否与数据结构匹配。
模型检查应强调“参数含义一致性”,避免设定漂移导致解释错位。
10.4 检验平行趋势与稳健性实验
在完成主估计后,进行识别检验与稳健性实验,例如:
- 事件研究前期系数联合检验;
- 图形与统计化预趋势检查;
- 安慰剂检验(置换干预时间、构造伪处理组);
- 替代聚类标准误、替代样本窗口或替代处理组定义。
这些实验的目的在于评估结论对关键假设的敏感性,而不是追求“无条件显著”。
10.5 形成因果叙事:把证据讲闭环
最后形成因果叙事,需要把以下证据链条闭合:
- 干预发生与处理组定义合理;
- 干预前趋势证据支持或至少未明显反对平行趋势;
- 干预后出现与机制相符的动态效应;
- 稳健性检验未显示结论对关键设定过度依赖。
当某环节证据不足,应在叙事中降低因果强度表述,并给出可能原因与替代解释。
11 相关方法对比
11.1 DID vs 纯截面比较(为什么会错)
纯截面比较通常只比较处理组与对照组在某一时期的差异,容易混入不可忽略的组别固有差异与宏观冲击差异。DID 的优势在于利用时间变化来抵消部分混杂来源,从而更接近因果识别所需的反事实结构。
如果处理发生的选择与结果水平或增长动力相关,截面比较尤其容易产生偏差。
11.2 DID vs 匹配(匹配的作用范围与 DID 的作用范围)
匹配方法主要通过在可观测特征层面对组别进行相似化处理,以降低选择偏差。DID 则通过时间差分和对照组趋势来处理未观测的时间不变差异及共同冲击。
两者可以互补:匹配提高可比性,DID 提供动态识别。但匹配不能替代平行趋势检验,DID 也不等价于“只要做了匹配就能自动成立因果”。
11.3 DID vs 回归连续性(概念差异)
回归连续性(Regression Discontinuity, RD)依赖阈值与局部可比性:在阈值附近,处理概率发生突变,因果识别来自阈值两侧的局部随机性。DID 则依赖时间维度的趋势结构与对照组演化。
因此二者适用场景不同:阈值明确时 RD 更自然,缺乏阈值但有时间冲击与对照时 DID 更常用。
11.4 DID vs 合成控制(适用场景直观对照)
合成控制通过为处理组构造加权对照路径,使干预前更贴近处理组。DID 则使用对照组的平均趋势来提供反事实变化。合成控制在干预前拟合表现较好时可能更贴近反事实;DID 在多时间、多单位或较标准的面板结构中更容易实施与解释。
在实践中,两者有时可结合或作为对照策略使用,用以评估估计的稳健性与识别强度。