形式陈述
给定处理前特征 X ,潜在结果框架 公理库 潜在结果框架 Potential outcomes framework · Rubin causal model 用同一单位在各个明确干预下的潜在结果定义因果效应,并把观测机制与科学目标分离。 中的条件平均处理效应是条件期望 公理库 条件期望 Conditional expectation 给定子 σ-代数后可测、并在所有已知事件上保持原积分的随机变量。
τ ( x ) = E { Y ( 1 ) − Y ( 0 ) ∣ X = x } , 定义在 P X 的支持上,并只确定到 P X -零测集。若 X 连续,写“每个 x ”通常应理解为几乎处处;在样本最边缘点给出的光滑曲线值可能纯属模型外推。
CATE 是一个函数 estimand,不是把总体 ATE 估计后再按样本切组。给定一致性、
( Y ( 0 ) , Y ( 1 ) ) ⊥ A ∣ X 以及对 P X -几乎处处的 x 和 a = 0 , 1 都有 P ( A = a ∣ X = x ) > 0 ,它由观测分布识别为
τ ( x ) = E ( Y ∣ A = 1 , X = x ) − E ( Y ∣ A = 0 , X = x ) . 若希望在更小的一组修饰变量 V = g ( X ) 上报告效应,正确目标为
τ V ( v ) = E { Y ( 1 ) − Y ( 0 ) ∣ V = v } . 识别时仍可能需要较丰富的混杂控制集 X ;一般不能只在 V 内做粗比较。估计则要从有限数据恢复整条函数,难度高于估计一个总体均值。
直觉
CATE 描述的是基线状态如何改变处理的平均后果。它要求修饰变量在干预前确定,否则按处理后的中介或存活状态分层会同时受处理影响,两个世界中的“同一子群”不再一致。
异质性还取决于效应尺度。风险差可能随年龄改变,而风险比保持稳定;这两句并不矛盾。模型中的 A × X 系数只是某个链接函数尺度上的交互参数,只有在模型正确且目标尺度对应时,它才直接代表 CATE 的变化。
例子与边界
设 X = 0 的人占 3 / 4 ,X = 1 占 1 / 4 。数据生成机制为
Y ( 0 ) = 2 + X + ε , Y ( 1 ) = 3 + 5 X + ε , E ( ε ∣ X ) = 0. 因此 τ ( 0 ) = 1 ,τ ( 1 ) = 5 ,总体 ATE 为 ( 3 / 4 ) × 1 + ( 1 / 4 ) × 5 = 2 。若另一个总体两层各占一半,而结构方程不变,其 ATE 变为 3;CATE 函数没有变,改变的是总体平均所用的权重。这一计算解释了为何试验效应向政策总体迁移需要目标协变量分布。
若处理在每个 X 层内随机,则两个条件均值之差识别上述 1 和 5。若在 X = 1 层所有人都接受处理,E ( Y ∣ A = 0 , X = 1 ) 没有观测支持;再平滑的模型也只能外推 τ ( 1 ) 。此时总体 ATE 也因该层权重为 1 / 4 而缺少非参数识别。
一个真实的失效边界是按治疗后的应答 M 分层。目标 E { Y ( 1 ) − Y ( 0 ) ∣ M = 1 } 把实际处理影响的 M 当作共同基线,处理组的 M ( 1 ) = 1 与对照组的 M ( 0 ) = 1 可能是不同的人。若科学问题确实关心“无论分到哪组都会应答者”,需定义 principal stratum,例如条件于 M ( 1 ) = M ( 0 ) = 1 ;该层通常不能由普通随机试验直接识别。
数据驱动地搜索许多子组也会制造赢家诅咒。即使真实 τ ( x ) 恒定,在几十个切点中挑最大差异,其报告值也系统偏大。样本拆分、预先指定修饰变量或对整条函数给出诚实区间,解决的是 estimation 的选择偏差;它们不能补回未测混杂或支持空洞。
推论与应用
由迭代期望,
E { τ ( X ) } = E [ E { Y ( 1 ) − Y ( 0 ) ∣ X } ] = E { Y ( 1 ) − Y ( 0 ) } , 所以总体 ATE 是 CATE 的目标总体平均。该推导同时表明,运输效应时既要假设 τ ( x ) 可跨总体复用,又要知道新总体对 x 的权重;只复制试验样本均值一般不够。
决策规则可由 CATE 导出:若处理成本在结果尺度上为 c ( x ) ,无资源约束时可考虑对 τ ( x ) > c ( x ) 者处理。但估计误差、伤害约束和容量限制会改变最优规则;把正的点估计直接当个体治疗建议,混淆了条件平均与个体反事实。
参考资料
Miguel A. Hernán and James M. Robins, Causal Inference: What If , Chapman & Hall/CRC, 2020,Ch. 4–5。
Kosuke Imai and Marc Ratkovic, “Estimating Treatment Effect Heterogeneity in Randomized Program Evaluation,” Annals of Applied Statistics 7(1), 2013, pp. 443–470。
Edward H. Kennedy, “Towards Optimal Doubly Robust Estimation of Heterogeneous Causal Effects,” Electronic Journal of Statistics 17(2), 2023, pp. 3008–3049。