形式陈述
结构因果模型是四元组 。 为外生随机变量公理库随机变量Random variable · Random element从概率空间到可测取值空间的可测映射;实值情形承载数值概率运算。集合, 为内生变量, 给出外生变量联合分布,结构方程组
其中 表示方程实际依赖的其他内生变量, 可以是外生向量的一部分,各个 不必独立。方程规定每个内生变量如何由其直接原因和外生扰动生成。递归 SCM 要求存在一个顺序,使 只依赖更早的内生变量;对应箭头 构成有向无环图公理库有向无环图Directed acyclic graph · DAG不含有向环的有向图。。给定 时方程有唯一解,推送 得到观测分布 。
原子干预 以常数方程 替换原方程,并保持其他方程和 不变。替换后的模型 诱导干预分布 。反事实 是同一个外生状态 在替换方程后的解;同一 把现实世界和反事实世界配对。
因果目标量例如 属于干预/反事实分布。识别问题问所有产生同一观测分布且满足图与结构限制的模型是否给它相同值;估计问题才从样本拟合右侧可识别泛函。SCM 提供语义,不保证任意效应由 识别。
直觉
每条方程是一个可替换模块:它描述变量在其原因给定时如何响应。观察 只是筛选自然系统中恰好生成 的单位;干预 则断开生成 的旧机制,把所有单位送入同一个赋值模块。两者不同,正是混杂产生时条件分布与干预分布不同的根源。
图只保留方程间的依赖骨架,函数和外生分布保留效应大小、非线性与潜在共同原因。相同图可以容纳很多观测分布;相同观测分布也可来自因果方向不同的模型。因此箭头含义来自模块化因果假设,而非相关矩阵自动画出的方向。
例子与边界
令 ,,,三者独立,并设
其中 为异或。图为 、、。由于 、,
把 的方程替换为 后, 的分布不变,故 ,,因果差为 1。这个可复算机制直接展示相关 不等于干预效应 1。
若 与 相关,却没有在图中加入表示共同外生原因的双向边语义,观测分布可能不再满足预期的因果 Markov 条件公理库因果 Markov 条件Causal Markov condition · Causal Markov assumption将因果图的 d-separation 结构映射为观测分布条件独立关系的 Markov 假设。。外生独立决定缺失箭头能否被解释成相应的条件独立;相关噪声并不使 SCM 失效,而是要求保留潜在共同原因。
SCM 与潜在结果表示可以相互翻译许多具体问题:方程替换生成 。但二者不能粗暴称为完全等价。SCM 通常对所有变量的生成机制和跨世界耦合给出更多结构;只给出 的潜在结果分析未必指定中介方程或因果图。
循环反馈、多个方程解和随机动态系统超出递归唯一解的简单版本。可以使用带时间展开、平衡选择规则或循环 SCM,但干预语义与可识别结论需要重新声明。用 DAG 强行表示同期反馈会丢失问题的核心。
仍用上面的加性模型,若已观察某人的 ,结构方程确定 。把同一个人的处理改为0后,;这与总体 不同。前者保留已观测个体的外生状态,后者对总体所有外生状态平均。这也说明反事实分析需要比总体干预均值更多的条件信息。
推论与应用
当递归 SCM 的外生扰动相互独立时,观测分布按图的父节点分解;这给出 d-separation 可读出的条件独立。干预替换一个方程后,相应入边删除,得到截断分解。由此再推导 backdoor 调整与 do-calculus,而不是把这些公式当回归恒等式。
反事实查询按“溯因—行动—预测”计算:先用已观测证据更新外生状态分布,再替换干预方程,最后在更新后的同一外生状态上求新结果。若只先验模拟一个独立新个体,得到的是总体干预分布,不是对已观察个体的反事实;两种量的条件信息不同。
参考资料
- Brady Neal, Introduction to Causal Inference from a Machine Learning Perspective, 在线教材,2020,§§2.3、4.5、7.1,作者稿。
- Judea Pearl, Madelyn Glymour, and Nicholas P. Jewell, Causal Inference in Statistics: A Primer, Wiley, 2016,§§1.5、3.2、4.2–4.3,作者公开稿。