形式陈述
在正确表示研究总体的因果 DAG 中,设处理节点 、结局节点 ,集合 与二者不交。 满足 backdoor 准则,当且仅当:
- 不含 的任何后代;
- 阻断 与 之间每条以箭头指向 开始的路径。
第二项用 d-separation 的路径规则判断。若递归 SCM 正确、观测分布满足因果 Markov 条件公理库因果 Markov 条件Causal Markov condition · Causal Markov assumption将因果图的 d-separation 结构映射为观测分布条件独立关系的 Markov 假设。、干预定义明确并满足一致性、 中变量在处理前测量,且对目标支持有 ,则do 算子公理库do 算子do-operator · Intervention operator通过替换变量的生成方程来表示外部干预,并定义干预后分布的算子。定义的效应由
识别。离散 时积分改为求和。定理允许 ;若没有开放后门路径,观测条件分布本身就是干预分布。
Backdoor 准则是充分条件而非所有可调整集的完整刻画,也不是所有可识别效应的必要条件。某些图没有满足它的观测集合,却仍可经 front-door 或一般 do-calculus 识别。
左侧 是 intervention estimand,等式给 identification;从有限样本估计 并积分才是 estimation。图上找到一个集合不会指定回归函数、平滑器或标准误。
直觉
从 沿出箭头走向 的路径承载处理的因果影响,不应为估计总效应而阻断。箭头进入 的路径说明处理选择与结局共享上游原因;对这些原因条件化,模拟在同一背景下比较处理。
“多调变量更安全”在图上并不成立。处理后中介会截掉部分真实作用,碰撞点则会打开原先关闭的非因果路径。准则的两条限制分别防止这两类常见错误。
准则关心的是路径角色,而不是某个变量与处理或结局的相关强弱。变量即使强烈预测 ,只要不在开放后门路径上,调整它也不负责去混杂;反之,共同原因的边缘相关即使很弱,仍可能是阻断路径不可缺的一环。先删去 的出边再追踪剩余开放路径,能把“去掉选择关联”与“保留因果传递”分开。
例子与边界
设图为 、、,并令 ,、,结果机制为
集合 不含处理后代,并阻断 。处理者中 ,所以 ;对照者中对应概率为 0.1,粗差为 1.8。调整后
与方程中把 从 0 改成 1 的效应一致。
若 未观测,空集没有阻断后门,粗差不具因果解释。加入只受 影响的噪声代理可以减少偏差,但除非给出测量模型等额外识别条件,代理并不等于观测到 。
碰撞点提供清晰反例。令 独立且各为 ,,图为 。不条件于 时 ;给定 后却有 ,产生完全相关。 是 的后代且位于碰撞路径,拿它“调整更多变量”会制造关联。
中介 位于 时也不应进入总效应的 backdoor 集。给定 后估计的可能是直接效应,且若 与 还有未测共同原因,条件化还会引入新偏差。estimand 改成直接效应需要专门的跨世界或干预定义。
图错画是准则最重要的边界。遗漏共同原因、误判时间顺序或在选择后的样本中使用总体图,都会让形式上合格的集合失效。数据中的条件独立可以反驳某些图,却通常不能唯一证明所选因果方向。
推论与应用
证明链可写成:在删除 出边的适当图中, 阻断后门使 ;一致性把 在 者中的分布替换为观测 ;positivity 使每个目标 的条件分布可获得;最后对自然 平均。图准则因此是交换性假设的结构化充分条件。
多个集合都满足准则时,它们给出相同总体识别量,但有限样本方差、测量误差与模型复杂度不同。通常避免不必要的强处理预测变量和高维集合可以改善精度;选择仍须先保证有效阻断,不能仅以预测分数最高为准。
参考资料
- Judea Pearl, Causality: Models, Reasoning, and Inference, 2nd ed., Cambridge University Press, 2009,Definition 3.3.1 与 Theorem 3.3.2。
- Judea Pearl, “Causal Diagrams for Empirical Research,” Biometrika 82(4), 1995, pp. 669–688。
- Marloes H. Maathuis and Diego Colombo, “A Generalized Back-Door Criterion,” Annals of Statistics 43(3), 2015, pp. 1060–1088。