“规模大时可从真实设计独立模拟分配,使用已有置换页说明的加一蒙特卡洛校准;不能把模拟比例的近似精度和完整枚举混为一谈。分层、配对及重随机化会改变支持集,分析必须沿用改变后的抽签。”
第一次抽签可能把协变量高值全分到处理组。重随机化允许预先规定:这样的分配不接受,重新抽一次。真正定义设计的不是“再抽得平衡一点”这句话,而是明确的接受集合及其诱导的概率分布。
形式陈述
将接受规则变成一个条件分布
固定处理前协变量表
每轮从原设计独立抽签,只保留首个通过者。最终分配的概率为
这正是正概率事件条件化。若原设计等权,最终在接受集合
在平衡的完全随机设计中,
则最终每个单位被处理的边缘概率仍为
针对尖锐零假设,使用Fisher 检验,但把原概率
直觉
拒绝再抽签与条件化是同一个分布
某个接受分配
补集对称则将每个接受分配与交换两臂后的分配一一配对,且二者权重相同。因此
这证明无偏性,不证明各单位处理指标独立,也不保留完全随机化原来的协方差。事实上,改变联合分配结构正是这个设计发挥作用的方式。
例子与边界
四人中剔除两份最不平衡的分配
取协变量
| 处理组 | 协变量均值差 | 是否接受 |
|---|---|---|
| 1、2 | 否 | |
| 1、3 | 是 | |
| 1、4 | 是 | |
| 2、3 | 是 | |
| 2、4 | 是 | |
| 3、4 | 否 |
最终每个保留分配概率为
若某次无效应检验中的固定结果为
图中灰色两份已不可能产生,不能继续给它们尾部权重;红色两份各占条件概率四分之一,所以正确 p 值为二分之一。
过紧平衡与不相关的结果变量
把阈值进一步收紧为零,只剩1、4与2、3。两者互为补集,任何固定结果的绝对均值差都相同,双侧检验 p 值恒为一。平衡改善了,却可能让分配支持过小、检验无法细分证据。
协变量更平衡也不保证所有结果变量方差都下降。仍用阈值一的四份支持,令两栏结果都为
仅在处理前决定,还不够保证均值差无偏
考虑仍固定两人处理,却只接受“一号进入处理组”。即使这个规则完全预先确定,若两栏结果均为
这里缺少补集对称,一号甚至没有进入对照组的机会。对不等臂人数或非对称规则,必须重新计算边缘纳入概率和适当估计量;“重随机化”这个名称不会替代证明。尖锐检验仍可按真实支持校准,但无偏平均效应估计是另一项要求。
推论与应用
实现时保存接受规则,而不只保存随机种子
对一维协变量,计算一次均值差需
若设置最大尝试次数后改用无约束抽签,最终分布变成另一种混合;若根据已经看到的失败分配逐步放宽阈值,也不再是上述固定事件条件化。两种改动都要明确建模并同步改变推断,不能只保留原来的公式。
统计量可以另外进行协变量调整,但检验模拟仍应遵守已接受的设计。固定
参考资料
- Kari Lock Morgan and Donald B. Rubin, Rerandomization to improve covariate balance in experiments, Annals of Statistics 40(2), 1263–1282, 2012,§2.2 的随机化推断、§2.3 Theorem 2.1 的补集对称无偏性。本文不采用该文 §3 中需要附加近似模型的普遍效率表述。
- Peng Ding, A First Course in Causal Inference 作者公开稿,§§6.1.1–6.1.2。本文六份分配、错误支持 p 值与方差增大反例均按有限表直接核算。