Skip to content

倾向分数

Propensity score · Treatment propensity

给定处理前协变量的处理条件概率,以及由此产生的平衡分数降维结果。

领域
统计学
条目类型
定义

形式陈述

二元处理的倾向分数是条件概率

e(X)=P(A=1X).

对多值处理使用向量 ea(X)=P(A=aX)。函数 b(X) 称为 balancing score,若 AXb(X)。Rosenbaum–Rubin 定理给出:

  1. e(X) 是 balancing score,即 AXe(X)
  2. b(X) 是 balancing score,则 e(X)b(X) 的函数,故倾向分数在该意义下是最粗平衡分数;
  3. 若强条件交换性 (Y(0),Y(1))AX 成立,且positivity 给出 0<e(X)<1 几乎处处,则 (Y(0),Y(1))Ae(X)

第一项由处理分配的条件分布定义推出,不需要结局模型;第三项才把平衡连接到因果识别。真实 e 是观测分布的泛函,估计的 e^ 是有限样本 nuisance estimator。匹配、分层、加权或协变量调整是不同 estimation 方法,不属于倾向分数定义。

直觉

若两名单位的具体协变量不同,但依据这些协变量接受处理的概率相同,那么在这个概率层里,处理分配不会继续偏向其中某一种协变量组合。倾向分数把高维分配机制压成一个标量,同时保留关于“谁更可能被处理”的信息。

这种压缩只平衡已纳入 X 的变量。漏掉共同原因后,模型可以把剩余变量平衡得极其漂亮,潜在结果仍不交换。倾向分数解决维度,不创造随机化。

所谓“最粗”不是只保留一个处理风险排名,而是任何有效的 balancing score 都必须足以确定 e(X):同一分数层若混入两个不同处理概率,处理组就会系统偏向概率较高的那类,X 的组成无法在两臂一致。因此一维压缩能成立,靠的是保留完整分配概率,而不是某个拟合模型碰巧只输出一个数字。

例子与边界

设总体有四种等量基线类型,每种 100 人,真实分配概率为

类型 一个关键特征 e(X) 期望处理人数 期望对照人数
I X=(0,0) 0.2 20 80
II X=(0,1) 0.2 20 80
III X=(1,0) 0.8 80 20
IV X=(1,1) 0.8 80 20

e=0.2 层,处理者来自 I、II 的期望比例为 20:20=1:1,对照者为 80:80=1:1e=0.8 层同理为 III、IV 各半。因此即使完整 X 有四类,给定 e(X) 后处理不再改变类型组成。若各类型潜在结果分布不同,只要强可忽略性给定完整 X 成立,定理仍允许在两个分数层中比较。

若错误模型把 I、II 的分数分别估为 0.1、0.3,它不再是同一个真实分数层;有限样本 balance 可能变差。反过来,处理组与对照组的样本均值偶然平衡也不证明 e^ 正确,更不证明未测混杂不存在。诊断应查看加权或匹配后协变量分布,而非用倾向模型的分类准确率;极高准确率常意味着 overlap 很差。

当 I 类从不处理时 e=0,平衡定理的概率陈述仍可形式讨论,但用该层识别两个处理结果失败。删除无匹配单位会把目标改成共同支持总体;这可能合理,却必须重新报告 estimand,而不能继续称全体 ATE。

把结局 Y 或处理后的变量放入倾向模型也有边界。Y 在分配时不可用,会泄漏结果;处理后变量可能是中介或碰撞点。变量选择应依据处理前信息和因果结构,随后才以预测与平衡性能调节函数形式。

推论与应用

由平衡性,给定真实 e(X) 后,任意可积函数 h(X) 在处理与对照中的条件分布相同。于是可以按分数匹配或分层;在每层有足够 overlap 且交换性成立时,层内结果差识别相应因果对比,再按目标总体权重组合。

逆概率权重来自同一条件概率:A/e(X)+(1A)/(1e(X)) 把实际分配的稀有单位放大,使加权伪总体中的 AX 解耦。估计 e 时应处理极端权重与不确定性;把分数当普通固定协变量塞进任意回归,不自动等于标准化或正确的因果调整。

参考资料
  • Paul R. Rosenbaum and Donald B. Rubin, “The Central Role of the Propensity Score in Observational Studies for Causal Effects,” Biometrika 70(1), 1983, pp. 41–55,Theorems 1–3。
  • Paul R. Rosenbaum and Donald B. Rubin, “Reducing Bias in Observational Studies Using Subclassification on the Propensity Score,” Journal of the American Statistical Association 79(387), 1984, pp. 516–524。
  • Guido W. Imbens and Donald B. Rubin, Causal Inference for Statistics, Social, and Biomedical Sciences, Cambridge University Press, 2015,Ch. 12–13。
关系图谱7 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系