形式陈述
令 表示处理, 为基线协变量, 为接受处理 时的潜在结果。强条件交换性使用条件独立公理库独立性Statistical independence从概率表理解独立性,区分两两、相互和条件独立,并用可计算反例澄清零协方差与条件均值的限度。,通常写为
即在潜在结果框架公理库潜在结果框架Potential outcomes framework · Rubin causal model用同一单位在各个明确干预下的潜在结果定义因果效应,并把观测机制与科学目标分离。中,对 、结果乘积空间中的每个可测集合 及 -几乎处处的 ,
逐个处理水平的条件交换性只要求 对每个 成立;它足以识别各潜在结果的边缘分布,不必进一步要求潜在结果向量与处理联合独立。识别均值还只需更弱的均值交换性
这里要求 。均值交换性弱于完整条件独立。结合一致性 与正值性 ,才有 。这是一条关于潜在结果和分配机制的识别假设;拟合倾向分数或结果回归是有限样本估计,不能把估计成功当作交换性证据。
无条件交换性 是随机试验常见目标。观察研究通过给定处理前共同原因 寻求条件版本。 必须在处理之前定义;纳入处理的后果可能打开碰撞路径或阻断欲估的总效应。
直觉
给定 后可交换,意思是同一层中实际接受哪种处理不再携带关于反事实结局的额外信息。因此该层的已处理者可以代表所有该层单位在处理世界中的结果,对照者也可以代表对照世界。
协变量平衡只检查被观察的 。真正的交换性同时涉及看不见的 ,所以不能由一张基线表证明。随机化用已知物理机制切断这种信息;观察研究依靠对共同原因的实质知识与测量,假设强度不同。
这里的“交换”也不要求 ,不要求两组观察到的 同分布,更不要求 与 彼此独立。它限制的是分配 是否携带潜在结果信息;它允许两组结局不同,却不保证存在个体效应时两组分布必然不同。例如公平比特 决定 、,每个人的效应都是 或 ,但独立随机分配处理后,两组结局都服从公平 Bernoulli 分布。个体变化、平均效应与分布变化是不同层次。
例子与边界
设 ,潜在结果由
生成。处理只通过 和一个独立随机数分配:,。因此 ,并且每层都有处理与对照的正概率。
先算处理比例 ,再用 Bayes 公式得到 。所以 ;对照者中 ,故 。粗差为 2.5,而每层处理差都为 2:
若只求已处理者的平均处理效应,目标变为 ,所需反事实只剩已处理者未接受处理时的结果;相应地,只需针对 的交换性和已处理者协变量支持内可找到对照的条件。不能把总体平均效应的假设强度与所有目标一概等同。
关联偏离因果效应并不与条件交换性矛盾;混杂存在于边缘比较,给定 后才被移除。
若研究只记录一个与 无关的变量 ,则边缘正值性仍成立,甚至两组的 完全平衡,但 继续透露 ,于是 。增大样本会把错误的 2.5 估得更稳定。这个反例说明预测处理很准或协变量平衡好都不是充分条件,关键是是否控制了处理与结局的共同原因。
另一个边界是选择错误变量。设 ,其中 原本随机;给定处理后的碰撞点 会使 与 相关,反而破坏交换性。在这个结构中可把偏差算出来:令 为独立公平二元变量,,,真实处理效应为零。只分析 的人时却必有 ,于是处理组均值为 1、对照组为 0,凭空出现差值 1。即使变量在处理前测量,若它是相关路径上的碰撞点,也不能仅凭时间早就安全调整。
相反,在控制集其余条件不变且没有打开其他路径时,遗漏仅预测结局而不影响处理的变量不会制造混杂,虽可能损失精度。控制集应由时间顺序和因果结构决定,而非把所有可用列机械塞入模型。
随机试验也可能在分析阶段失去简单交换性:失访若同时受处理和潜在结局影响,完整病例中的分配不再可交换;存在不依从但结局完整观测时,按随机分配比较的意向治疗效应仍可识别;按实际治疗或依方案比较则不能直接沿用这项保证。
推论与应用
交换性给出
一致性把右端替换为 ,对 使用迭代期望即得标准化公式。若正值性缺失,右端某些层无定义;三项假设没有一项能代替另一项。
倾向分数公理库倾向分数Propensity score · Treatment propensity给定处理前协变量的处理条件概率,以及由此产生的平衡分数降维结果。 的平衡定理进一步表明,在条件交换性与正值性下,可从高维 压缩到 而保持对应的交换性。这个结论可从迭代条件期望看出:给定 后,处理概率在该层恒定;再利用给定 的交换性,处理分配不会改变层内潜在结果的混合分布。它减少了调整维度,却不会把未测共同原因变成已测变量。应用中应明确交换性相对于哪个处理、结局、随访时点和控制集提出,并用敏感性分析量化假设偏离,而非宣称“已证明无混杂”。
参考资料