形式陈述
记 m a ( x ) = E ( Y ∣ A = a , X = x ) ,e ( x ) = P ( A = 1 ∣ X = x ) 。ATE 的增广逆概率加权得分为
ψ ( O ; m , e ) = m 1 ( X ) − m 0 ( X ) + A e ( X ) { Y − m 1 ( X ) } − 1 − A 1 − e ( X ) { Y − m 0 ( X ) } . 在一致性 理路 因果推断的一致性假设 Consistency assumption in causal inference · Potential-outcome consistency 实际接受的明确处理版本与相应潜在结果相接,使观测结果等于该干预下结果的假设。 、条件交换性 理路 条件交换性 Conditional exchangeability · Conditional ignorability · Unconfoundedness 给定充分的处理前协变量后,处理分配与各处理潜在结果条件独立的识别假设。 与positivity 理路 Positivity 假设 Positivity assumption · Overlap assumption 目标总体每个相关协变量层中,各待比较处理都具有正条件概率的支持条件。 这些识别条件下,若 m ∗ = m 或 e ∗ = e 在 P X 下几乎处处成立,至少一者成立,则
E { ψ ( O ; m ∗ , e ∗ ) } = E { Y ( 1 ) − Y ( 0 ) } . 这里还要求候选 e ∗ 在目标支持上严格介于 0 与 1,得分各项可积。前半项是标准化 理路 因果调整公式 Adjustment formula · Standardization formula · G-formula 在一致性、条件交换性与 positivity 下,以观测条件结局分布标准化识别干预分布的公式。 plug-in,残差项来自IPTW 理路 逆概率处理加权 Inverse probability treatment weighting · IPTW · Inverse propensity weighting 以实际处理概率的倒数重加权观测,使各处理组代表同一目标总体的因果估计方法。 。样本估计将 nuisance 函数替换为 m ^ , e ^ 并平均 ψ 。双重稳健指两个观测 nuisance 模型的“一者正确”性质;它不允许一致性、交换性或支持假设任意失败。
以 IID 样本、固定折数且各折大小与 n 同阶的交叉拟合为例,一组充分条件是:真实与估计倾向均落在 [ ε , 1 − ε ] ,ε > 0 ;m a ∈ L 2 ( P X ) ,且两组条件方差 Var ( Y ∣ A = a , X ) 一致有界;每折在其余数据上拟合的 m ^ a , e ^ 都在 L 2 ( P X ) 中一致。此时二阶偏差由常数倍的
( ∑ a = 0 1 ‖ m ^ a − m a ‖ L 2 ( P X ) ) ‖ e ^ − e ‖ L 2 ( P X ) 控制。若每折的乘积为 o p ( n − 1 / 2 ) ,便得到以真实中心化得分为影响函数的渐近线性展开;该得分方差严格为正时可作通常的 n 正态推断。“至少一个一致”并不自动给出这组速率与方差条件。
直觉
图片加载失败 AIPW 双重稳健汇合 结局回归先为每人预测两个处理世界;IP 残差再检查实际观察到的世界是否系统偏离预测。若结局模型正确,残差在每个 ( A , X ) 层均值为零,错误权重无从制造偏差。若倾向模型正确,残差加权恰好补回结局模型在各 X 层的平均误差。
这不是两次估计后挑更顺眼的结果,而是一条具有正交结构的估计方程。两个模型同时很差时,两个误差会相乘留下偏差;“双重”并非“比任何单模型都保险”。
例子与边界
只看处理均值 μ 1 。令 X ∼ Bernoulli ( 1 / 2 ) ,真实 e ( 0 ) = 0.25 , e ( 1 ) = 0.75 ,真实处理结局均值 m 1 ( 0 ) = 1 , m 1 ( 1 ) = 3 ,故 μ 1 = 2 。AIPW 单臂得分为
ϕ 1 = m 1 ∗ ( X ) + A e ∗ ( X ) { Y − m 1 ∗ ( X ) } . 先让倾向正确而结局模型错误为常数 m 1 ∗ = 1.5 。条件平均残差修正为 m 1 ( X ) − 1.5 ,对两层平均是 { ( 1 − 1.5 ) + ( 3 − 1.5 ) } / 2 = 0.5 ,故 E ( ϕ 1 ) = 1.5 + 0.5 = 2 。更一般地,e ∗ = e 时修正恰为 E { m 1 ( X ) − m 1 ∗ ( X ) } ,抵消 plug-in 误差。
反过来若 m 1 ∗ = m 1 ,即使误设 e ∗ ( x ) = 0.5 ,也有 E { Y − m 1 ( X ) ∣ A = 1 , X } = 0 ,残差项均值为零,仍得到 2。
两者都错时保证消失。取 m 1 ∗ = 1.5 , e ∗ = 0.5 ,修正均值为
1 2 [ 0.25 0.5 ( 1 − 1.5 ) + 0.75 0.5 ( 3 − 1.5 ) ] = 1 , 所以 E ( ϕ 1 ) = 2.5 ,偏离真值 2。这个反例排除了“两个有偏模型自动互相修复”的误解。
接近零的真实倾向概率仍会让残差项爆炸;结局模型正确可减弱方差,却不把结构 positivity 违规变成识别。有限样本中,用同一数据高度自适应拟合 nuisance 与计算得分会引入过拟合偏差,cross-fitting 通过样本外预测缓解,但小样本折数和算法不稳定仍需诊断。
推论与应用
在非参数观测模型中,若目标沿二次均值可微子模型作正则路径微分,且真实中心化得分 ψ ( O ; m , e ) − ATE 属于 L 0 2 ( P ) ,它就是 ATE 的有效影响函数。仅有 positivity 与一阶可积性不保证这个有限方差条件;实际拟合后的估计量还需上述余项与非退化条件,才能据此构造方差估计和 Wald 区间。半参数效率 理路 半参数效率与有效影响函数 Semiparametric efficiency · Efficient influence function · Canonical gradient · 典范梯度 用可微子模型的得分空间刻画正则估计的首阶方差界,并完整求出随机缺失均值的有效影响函数。 以对应的缺失均值问题逐项验证得分配对和切空间成员资格,解释“有效”来自何种方差下界。正交性使 nuisance 的一阶小扰动不直接进入目标误差,因而允许使用比参数模型更慢的学习器;所需速率、Donsker 条件或交叉拟合条件必须随具体估计器说明。
双重稳健结构也用于缺失数据、删失和纵向处理,但每个场景的 nuisance 与权重因子不同。纵向情形常要求多个时点的处理/删失模型或一串结局回归满足特定组合正确性,不能把横断面 AIPW 公式原样复制。
参考资料
Heejung Bang and James M. Robins, “Doubly Robust Estimation in Missing Data and Causal Inference Models,” Biometrics 61(4), 2005, pp. 962–973。
James M. Robins, Andrea Rotnitzky, and Lue Ping Zhao, “Estimation of Regression Coefficients When Some Regressors Are Not Always Observed,” Journal of the American Statistical Association 89(427), 1994, pp. 846–866。
Mark J. van der Laan and Sherri Rose, Targeted Learning , Springer, 2011,Ch. 2–5。
Victor Chernozhukov et al., “Double/Debiased Machine Learning for Treatment and Structural Parameters,” Econometrics Journal 21(1), 2018, pp. C1–C68。