形式陈述
给定处理前特征 X ,潜在结果框架 公理库 潜在结果框架 Potential outcomes framework · Rubin causal model 用同一单位在各个明确干预下的潜在结果定义因果效应,并把观测机制与科学目标分离。 中的条件平均处理效应是条件期望 公理库 条件期望 Conditional expectation 以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。
τ ( x ) = E { Y ( 1 ) − Y ( 0 ) ∣ X = x } , 定义在 P X 的支持上,并只确定到 P X -零测集。若 X 连续,写“每个 x ”通常应理解为几乎处处;在样本最边缘点给出的光滑曲线值可能纯属模型外推。
CATE 是一个以协变量为输入的目标函数,不是把总体 ATE 估计后再按样本切组。给定一致性、
( Y ( 0 ) , Y ( 1 ) ) ⊥ A ∣ X 以及对 P X -几乎处处的 x 和 a = 0 , 1 都有 P ( A = a ∣ X = x ) > 0 ,它由观测分布识别为
τ ( x ) = E ( Y ∣ A = 1 , X = x ) − E ( Y ∣ A = 0 , X = x ) . 若希望在更小的一组修饰变量 V = g ( X ) 上报告效应,正确目标为
τ V ( v ) = E { Y ( 1 ) − Y ( 0 ) ∣ V = v } . 识别时仍可能需要较丰富的混杂控制集 X 。令 m a ( X ) = E ( Y ∣ A = a , X ) ,迭代期望给出
τ V ( v ) = E { m 1 ( X ) − m 0 ( X ) ∣ V = v } . 先在足够细的 X 层消除混杂,再按 X ∣ V = v 的共同分布平均;直接比较两个处理组的 V 层均值,通常使用了不同的 X 权重。估计则要从有限数据恢复整条函数,难度高于估计一个总体均值。
直觉
CATE 描述的是基线状态如何改变处理的平均后果。它要求修饰变量在干预前确定,否则按处理后的中介或存活状态分层会同时受处理影响,两个世界中的“同一子群”不再一致。
异质性还取决于效应尺度。风险差可能随年龄改变,而风险比保持稳定;这两句并不矛盾。模型中的 A × X 系数只是某个链接函数尺度上的交互参数,只有在模型正确且目标尺度对应时,它才直接代表 CATE 的变化。
例子与边界
设 X = 0 的人占 3 / 4 ,X = 1 占 1 / 4 。数据生成机制为
Y ( 0 ) = 2 + X + ε , Y ( 1 ) = 3 + 5 X + ε , E ( ε ∣ X ) = 0. 因此 τ ( 0 ) = 1 ,τ ( 1 ) = 5 ,总体 ATE 为 ( 3 / 4 ) × 1 + ( 1 / 4 ) × 5 = 2 。若另一个总体两层各占一半,而结构方程不变,其 ATE 变为 3;CATE 函数没有变,改变的是总体平均所用的权重。这解释了为何效应迁移需要目标协变量分布。
这个例子还刻意使用了两世界共享的同一 ε ,所以每层个体差恰好恒定。若把两式的误差改为 ε 0 , ε 1 ,仅要求它们的条件均值均为零,则 CATE 仍是1和5,但个体差还含 ε 1 − ε 0 ;即使 CATE 已知,也不知道某个人的真实获益。
若处理在每个 X 层内随机,则两个条件均值之差识别上述 1 和 5。若在 X = 1 层所有人都接受处理,E ( Y ∣ A = 0 , X = 1 ) 没有观测支持;再平滑的模型也只能外推 τ ( 1 ) 。此时总体 ATE 也因该层权重为 1 / 4 而缺少非参数识别。
一个真实的失效边界是按治疗后的应答 M 分层。目标 E { Y ( 1 ) − Y ( 0 ) ∣ M = 1 } 把实际处理影响的 M 当作共同基线,处理组的 M ( 1 ) = 1 与对照组的 M ( 0 ) = 1 可能是不同的人。若科学问题确实关心“无论分到哪组都会应答者”,需定义 主分层,例如条件于 M ( 1 ) = M ( 0 ) = 1 ;该层通常不能由普通随机试验直接识别。
数据驱动地搜索许多子组也会制造赢家诅咒。即使真实 τ ( x ) 恒定,在几十个切点中挑最大差异,其报告值也系统偏大。样本拆分、预先指定修饰变量或对整条函数给出诚实区间,解决的是估计阶段的选择偏差;它们不能补回未测混杂或支持空洞。
推论与应用
由迭代期望,
E { τ ( X ) } = E [ E { Y ( 1 ) − Y ( 0 ) ∣ X } ] = E { Y ( 1 ) − Y ( 0 ) } , 所以总体 ATE 是 CATE 的目标总体平均。该推导同时表明,迁移效应时既要假设 τ ( x ) 可跨总体复用,又要知道新总体对 x 的权重;只复制试验样本均值一般不够。
决策规则可由 CATE 导出:若处理成本在结果尺度上为 c ( x ) ,无资源约束时可考虑对 τ ( x ) > c ( x ) 者处理。但估计误差、伤害约束和容量限制会改变最优规则;把正的点估计直接当个体治疗建议,混淆了条件平均与个体反事实。
参考资料
Brady Neal, Introduction to Causal Inference from a Machine Learning Perspective , 在线教材,2020,§§2.3、4.5、7.1,作者稿 。
Judea Pearl, Madelyn Glymour, and Nicholas P. Jewell, Causal Inference in Statistics: A Primer , Wiley, 2016,§§1.5、3.2、4.2–4.3,作者公开稿 。
Edward H. Kennedy, “Towards Optimal Doubly Robust Estimation of Heterogeneous Causal Effects,” Electronic Journal of Statistics 17(2), 2023, pp. 3008–3049,§§2.1–2.2,作者稿 。