“设 $e(X)=P(A=1\mid X)$ 是倾向分数。在明确处理的一致性、$(Y(0),Y(1))\perp A\mid X$ 的条件交换性、以及 $0<e(X)<1$ 几乎处处的posi…”
形式陈述 ​
二元处理的倾向分数是条件概率
对多值处理使用向量
是 balancing score,即 ; - 若
是 balancing score,则 是 的函数,故倾向分数在该意义下是最粗平衡分数; - 若强条件交换性
成立,且positivity 给出 几乎处处,则 。
第一项由处理分配的条件分布定义推出,不需要结局模型;第三项才把平衡连接到因果识别。真实
直觉
若两名单位的具体协变量不同,但依据这些协变量接受处理的概率相同,那么在这个概率层里,处理分配不会继续偏向其中某一种协变量组合。倾向分数把高维分配机制压成一个标量,同时保留关于“谁更可能被处理”的信息。
这种压缩只平衡已纳入
所谓“最粗”不是只保留一个处理风险排名,而是任何有效的 balancing score 都必须足以确定
例子与边界
设总体有四种等量基线类型,每种 100 人,真实分配概率为
| 类型 | 一个关键特征 | 期望处理人数 | 期望对照人数 | |
|---|---|---|---|---|
| I | 0.2 | 20 | 80 | |
| II | 0.2 | 20 | 80 | |
| III | 0.8 | 80 | 20 | |
| IV | 0.8 | 80 | 20 |
在
若错误模型把 I、II 的分数分别估为 0.1、0.3,它不再是同一个真实分数层;有限样本 balance 可能变差。反过来,处理组与对照组的样本均值偶然平衡也不证明
当 I 类从不处理时
把结局
推论与应用
由平衡性,给定真实
逆概率权重来自同一条件概率:
参考资料
- Paul R. Rosenbaum and Donald B. Rubin, “The Central Role of the Propensity Score in Observational Studies for Causal Effects,” Biometrika 70(1), 1983, pp. 41–55,Theorems 1–3。
- Paul R. Rosenbaum and Donald B. Rubin, “Reducing Bias in Observational Studies Using Subclassification on the Propensity Score,” Journal of the American Statistical Association 79(387), 1984, pp. 516–524。
- Guido W. Imbens and Donald B. Rubin, Causal Inference for Statistics, Social, and Biomedical Sciences, Cambridge University Press, 2015,Ch. 12–13。