形式陈述
在正确表示研究总体的因果 DAG 中,设处理节点 、结局节点 ,集合 与二者不交。 满足 backdoor 准则,当且仅当:
- 不含 的任何后代;
- 阻断 与 之间每条以箭头指向 开始的路径。
第二项用 d-separation 的路径规则判断:路径上有被条件化的非碰撞点,或者有一个自身及后代都未被条件化的碰撞点,路径才被阻断。条件化碰撞点的后代也可能打开路径,不能只检查碰撞点本身。
假设 来自机制在干预下保持不变的递归结构因果模型,未画出的外生扰动相互独立;共享扰动须作为潜变量在图中表示。该模型蕴含因果 Markov 条件公理库因果 Markov 条件Causal Markov condition · Causal Markov assumption将因果图的 d-separation 结构映射为观测分布条件独立关系的 Markov 假设。。再要求干预定义明确并满足一致性,且在目标总体的 支持上,欲比较的处理水平有正条件概率(连续处理则用条件密度的支持条件),则do 算子公理库do 算子do-operator · Intervention operator通过替换变量的生成方程来表示外部干预,并定义干预后分布的算子。定义的效应由
识别。离散 时积分改为求和。图准则要求“不含处理后代”;处理前测量是常用的选变量原则,但测量日历时间本身不是定理的第三条图条件。单有观测分布的 Markov 分解,也不足以推出干预后机制不变。定理允许 ;若没有开放后门路径,观测条件分布本身就是干预分布。
Backdoor 准则是充分条件而非所有可调整集的完整刻画,也不是所有可识别效应的必要条件。某些图没有满足它的观测集合,却仍可经 front-door 或一般 do-calculus 识别。
左侧 是干预目标,等式完成从因果量到观测分布的识别;从有限样本拟合 并积分才是估计。图上找到一个集合不会指定回归函数、平滑器或标准误。
直觉
从 到 沿途箭头全部向前的有向路径承载处理的因果影响,不应为估计总效应而阻断。箭头进入 的路径说明处理选择与结局共享上游原因;对这些原因条件化,模拟在同一背景下比较处理。
“多调变量更安全”在图上并不成立。处理后中介会截掉部分真实作用,碰撞点则会打开原先关闭的非因果路径。准则的两条限制分别防止这两类常见错误。
准则关心的是路径角色,而不是某个变量与处理或结局的相关强弱。变量即使强烈预测 ,只要不在开放后门路径上,调整它也不负责去混杂;反之,共同原因的边缘相关即使很弱,仍可能是阻断路径不可缺的一环。先删去 的出边再追踪剩余开放路径,能把“去掉选择关联”与“保留因果传递”分开。
有效与无效的后门调整
例子与边界
设图为 、、,并令 ,、,结果机制为
集合 不含处理后代,并阻断 。处理者中 ,所以 ;对照者中对应概率为 0.1,粗差为 1.8。调整后
与方程中把 从 0 改成 1 的效应一致。
若 未观测,空集没有阻断后门,粗差不具因果解释。加入只受 影响的噪声代理有时可以减少偏差,但除非给出测量模型等额外识别条件,代理并不等于观测到 。
碰撞点提供清晰反例。令 独立且各为 ,,图为 。不条件于 时 ;给定 后却有 ,产生完全相关。 是 的后代且位于碰撞路径,拿它“调整更多变量”会制造关联。
中介 位于 时也不应进入总效应的 backdoor 集。给定 后估计的可能是直接效应,且若 与 还有未测共同原因,条件化还会引入新偏差。目标改成直接效应需要专门的跨世界或干预定义。
图错画是准则最重要的边界。遗漏共同原因、误判时间顺序或在选择后的样本中使用总体图,都会让形式上合格的集合失效。数据中的条件独立可以反驳某些图,却通常不能唯一证明所选因果方向。
推论与应用
证明链可写成:在删除 出边的适当图中, 阻断后门使 ;一致性把 在 者中的分布替换为观测 ;正值性使每个目标 的条件分布可获得;最后对自然 平均。图准则因此是条件交换性公理库条件交换性Conditional exchangeability · Conditional ignorability · Unconfoundedness给定充分的处理前协变量后,处理分配与各处理潜在结果条件独立的识别假设。的结构化充分条件;这项充分性无需假定忠实性,参数抵消造成的额外独立不影响结论。
多个集合都满足准则时,它们给出相同总体识别量,但有限样本方差、测量误差与模型复杂度不同。通常避免不必要的强处理预测变量和高维集合可以改善精度;选择仍须先保证有效阻断,不能仅以预测分数最高为准。
参考资料