形式陈述
记 m a ( x ) = E ( Y ∣ A = a , X = x ) ,e ( x ) = P ( A = 1 ∣ X = x ) 。ATE 的增广逆概率加权得分为
ψ ( O ; m , e ) = m 1 ( X ) − m 0 ( X ) + A e ( X ) { Y − m 1 ( X ) } − 1 − A 1 − e ( X ) { Y − m 0 ( X ) } . 在一致性 公理库 因果推断的一致性假设 Consistency assumption in causal inference · Potential-outcome consistency 实际接受的明确处理版本与相应潜在结果相接,使观测结果等于该干预下结果的假设。 、条件交换性 公理库 条件交换性 Conditional exchangeability · Conditional ignorability · Unconfoundedness 给定充分的处理前协变量后,处理分配与各处理潜在结果条件独立的识别假设。 与positivity 公理库 Positivity 假设 Positivity assumption · Overlap assumption 目标总体每个相关协变量层中,各待比较处理都具有正条件概率的支持条件。 这些识别条件下,若 m ∗ = m 或 e ∗ = e 在 P X 下几乎处处成立,至少一者成立,则
E { ψ ( O ; m ∗ , e ∗ ) } = E { Y ( 1 ) − Y ( 0 ) } . 这里还要求候选 e ∗ 在目标支持上严格介于 0 与 1,得分各项可积。前半项是标准化 公理库 因果调整公式 Adjustment formula · Standardization formula · G-formula 在一致性、条件交换性与 positivity 下,以观测条件结局分布标准化识别干预分布的公式。 plug-in,残差项来自IPTW 公理库 逆概率处理加权 Inverse probability treatment weighting · IPTW · Inverse propensity weighting 以实际处理概率的倒数重加权观测,使各处理组代表同一目标总体的因果估计方法。 。样本估计将 nuisance 函数替换为 m ^ , e ^ 并平均 ψ 。双重稳健指两个观测 nuisance 模型的“一者正确”性质;它不允许一致性、交换性或支持假设任意失败。
若两 nuisance 都以足够速度收敛,交叉拟合 AIPW 的二阶余项通常受乘积
‖ m ^ − m ‖ ‖ e ^ − e ‖ 控制。乘积为 o p ( n − 1 / 2 ) 并满足矩与 overlap 条件时,可获得渐近线性和 n 推断;“至少一个一致”只保证目标一致性的典型结论,不自动给有效标准误。
直觉
结局回归先为每人预测两个处理世界;IP 残差再检查实际观察到的世界是否系统偏离预测。若结局模型正确,残差在每个 ( A , X ) 层均值为零,错误权重无从制造偏差。若倾向模型正确,残差加权恰好补回结局模型在各 X 层的平均误差。
这不是两次估计后挑更顺眼的结果,而是一条具有正交结构的估计方程。两个模型同时很差时,两个误差会相乘留下偏差;“双重”并非“比任何单模型都保险”。
例子与边界
只看处理均值 μ 1 。令 X ∼ Bernoulli ( 1 / 2 ) ,真实 e ( 0 ) = 0.25 , e ( 1 ) = 0.75 ,真实处理结局均值 m 1 ( 0 ) = 1 , m 1 ( 1 ) = 3 ,故 μ 1 = 2 。AIPW 单臂得分为
ϕ 1 = m 1 ∗ ( X ) + A e ∗ ( X ) { Y − m 1 ∗ ( X ) } . 先让倾向正确而结局模型错误为常数 m 1 ∗ = 1.5 。条件平均残差修正为 m 1 ( X ) − 1.5 ,对两层平均是 { ( 1 − 1.5 ) + ( 3 − 1.5 ) } / 2 = 0.5 ,故 E ( ϕ 1 ) = 1.5 + 0.5 = 2 。更一般地,e ∗ = e 时修正恰为 E { m 1 ( X ) − m 1 ∗ ( X ) } ,抵消 plug-in 误差。
反过来若 m 1 ∗ = m 1 ,即使误设 e ∗ ( x ) = 0.5 ,也有 E { Y − m 1 ( X ) ∣ A = 1 , X } = 0 ,残差项均值为零,仍得到 2。
两者都错时保证消失。取 m 1 ∗ = 1.5 , e ∗ = 0.5 ,修正均值为
1 2 [ 0.25 0.5 ( 1 − 1.5 ) + 0.75 0.5 ( 3 − 1.5 ) ] = 1 , 所以 E ( ϕ 1 ) = 2.5 ,偏离真值 2。这个反例排除了“两个有偏模型自动互相修复”的误解。
接近零的真实倾向概率仍会让残差项爆炸;结局模型正确可减弱方差,却不把结构 positivity 违规变成识别。有限样本中,用同一数据高度自适应拟合 nuisance 与计算得分会引入过拟合偏差,cross-fitting 通过样本外预测缓解,但小样本折数和算法不稳定仍需诊断。
推论与应用
把 ψ − E { ψ } 看作 ATE 的有效影响函数,可以推导 sandwich 型方差与 Wald 区间。正交性使 nuisance 的一阶小扰动不直接进入目标误差,因而允许使用比参数模型更慢的学习器;所需速率、Donsker 条件或交叉拟合条件必须随具体估计器说明。
双重稳健结构也用于缺失数据、删失和纵向处理,但每个场景的 nuisance 与权重因子不同。纵向情形常要求多个时点的处理/删失模型或一串结局回归满足特定组合正确性,不能把横断面 AIPW 公式原样复制。
参考资料
Heejung Bang and James M. Robins, “Doubly Robust Estimation in Missing Data and Causal Inference Models,” Biometrics 61(4), 2005, pp. 962–973。
James M. Robins, Andrea Rotnitzky, and Lue Ping Zhao, “Estimation of Regression Coefficients When Some Regressors Are Not Always Observed,” Journal of the American Statistical Association 89(427), 1994, pp. 846–866。
Mark J. van der Laan and Sherri Rose, Targeted Learning , Springer, 2011,Ch. 2–5。
Victor Chernozhukov et al., “Double/Debiased Machine Learning for Treatment and Structural Parameters,” Econometrics Journal 21(1), 2018, pp. C1–C68。