实验结束后,每个人只有一个结果被看见。怎样知道另一种抽签会产生多大的组间差?若假设“处理对每个人都没有影响”,已经看见的结果就能补上另一栏。随后重做的是原实验的抽签,而不是任意打乱数据。
形式陈述
尖锐假设补全什么
固定 N 个单位的潜在结果 理路 潜在结果框架 Potential outcomes framework · Rubin causal model 用同一单位在各个明确干预下的潜在结果定义因果效应,并把观测机制与科学目标分离。 Y i ( 0 ) , Y i ( 1 ) ,假定无单位间干扰、处理版本明确。分配向量 Z ∈ Ω ⊆ { 0 , 1 } N 按已知概率 π ( z ) > 0 产生,∑ z ∈ Ω π ( z ) = 1 。这与有限总体设计 理路 有限总体抽样设计 Finite population sampling design 把有限总体数值固定、样本集合随机,区分一阶纳入机会与决定方差的联合抽取结构。 一样,把表中数值固定,概率只对选中哪些单位取。
实际观察到 z o b s 和 Y i o b s = Y i ( z i o b s ) 。尖锐零假设
对 每 个 H F : Y i ( 1 ) = Y i ( 0 ) 对每个 i 使两栏都等于 Y i o b s 。因此对每个允许分配 z ,都能计算预定统计量 T ( z , Y o b s ) 。规定大值更反对零假设,定义
p F = ∑ z ∈ Ω π ( z ) 1 { T ( z , Y o b s ) ≥ T ( z o b s , Y o b s ) } . 在 H F 下这是有效p 值 理路 p 值 p-value 在零假设下校准的证据统计量,其小值事件的概率不超过对应阈值。 :对任意 u ∈ [ 0 , 1 ] ,Pr π ( p F ≤ u ) ≤ u 。双侧检验可以事先取绝对组均值差;“双侧”必须落实为一个完整的极端性排序。
更一般的尖锐假设可逐人规定已知效应 δ i 。这时先补全 Y i ( 0 ) = Y i o b s − z i o b s δ i 、Y i ( 1 ) = Y i ( 0 ) + δ i ,每次候选分配都重新生成其观测结果。仅规定平均效应为零,不足以完成这个步骤。
直觉
尾部概率按真实抽签重量累加
在零假设下,补全后的结果表不随实际抽签变化。将统计量的不同取值从大到小排为 t 1 > ⋯ > t K ,把对应的设计概率合并为 w 1 , … , w K 。若实现值为 t j ,其 p 值就是累计重量
q j = w 1 + ⋯ + w j . 事件 p F ≤ u 恰好收集某个最前面的取值段,概率为该段末端的 q j ≤ u ;若没有这样的段,概率为零。这证明了有限样本有效性,也说明并列值为何要一起纳入尾部。没有要求结果正态、方差齐性或单位来自 IID 抽样。
“精确”指校准使用真实有限分布,不表示错误率恰等于每一个名义水平。有限个分配只有有限个累计概率,许多水平根本无法用完。未经额外随机化就把并列质量只算一半,会改变这里的保证。
例子与边界
不等概率抽签不能按分配数除
三名单位恰有一人接受处理,选中一、二、三号的概率分别为 1 / 2 , 1 / 3 , 1 / 6 。在无效应假设下,固定结果为 ( 3 , 1 , 0 ) ,统计量取处理者的结果。三个可能的报告为:
处理者
统计量
正确加权 p 值
一号
3
1 / 2
二号
1
5 / 6
三号
0
1
若实际抽中一号,尾部只包含这个分配,但它的重量是一半,不是三分之一。错误地把三个分配等权处理,会在水平 1 / 3 时以概率 1 / 2 拒绝真实零假设。程序列举得再完整,也无法修复用错的概率。
平均为零仍可能拒绝得太多
取四人、等概率选两人处理,令 Y ( 0 ) = ( 0 , 0 , 0 , 0 ) 、Y ( 1 ) = ( − 1 , − 1 , − 1 , 3 ) 。个体效应平均恰为零,但并不逐人等于零。
若处理组不含四号,三种分配都观察到处理结果 ( − 1 , − 1 ) 、对照结果 ( 0 , 0 ) 。错误套用无效应补全后,六个绝对均值差中只有两个达到观察值一,所以 p 值为 1 / 3 。若处理组含四号,另外三种分配的观察结果为 ( − 1 , 3 , 0 , 0 ) 的相应排列,六个绝对均值差均至少为一,p 值为一。
因此把这套检验误称为“平均效应为零”的水平 1 / 3 检验,会以概率 3 / 6 = 1 / 2 拒绝一个真实的平均零假设。Fisher 校准没有失效,错误在于把尖锐假设替换成了较弱的目标。Neyman 随机化方差 理路 Neyman 随机化方差 Neyman randomization variance · Finite-population treatment-effect variance 在固定潜在结果和完全随机分配下推导均值差的精确方差,分离不可观测的效应异质项,并证明常用方差估计只在设计期望上保守。 直接研究异质效应下的平均效应估计,但不会自动得到同一个精确检验。
允许重新计算,不能事后挑规则
统计量可以包含拟合过程,只要每个候选分配都按预定的同一算法重新拟合。反过来,先看结果挑出最显著的统计量,再只对选中的统计量算尾部,不是已经证明的程序。观测研究的标签也不能因为容易洗牌就获得真实抽签解释;置换检验 理路 置换检验 Permutation test · Randomization test 利用零假设下数据对一组变换的分布不变性,构造有限样本精确检验。 还可能依靠另一种分布不变性,需要单独建立。
推论与应用
从设计记录到复算结果
保存分配支持集、每个分配的概率、假设补全规则和统计量方向。完全随机分配 n 1 人时共有 M = ( N n 1 ) 个分配,直接枚举的时间为 O ( M C T ) ,C T 是一次重造数据及计算统计量的成本;顺序累计尾重无需保存全部统计量。组均值差朴素计算可取 C T = O ( N ) 。
规模大时可从真实设计 独立模拟分配,使用已有置换页说明的加一蒙特卡洛校准;不能把模拟比例的近似精度和完整枚举混为一谈。分层、配对及重随机化 理路 重随机化设计 Rerandomization design · Covariate-balance rerandomization 在处理前固定协变量平衡规则,对原分配分布按接受事件条件化,证明补集对称下的无偏性,并按受限支持集重新校准检验。 会改变支持集,分析必须沿用改变后的抽签。
若想估计一个恒定效应而非只检验零,可对候选效应逐个补全并用随机化检验反演 理路 恒定效应随机化反演 Randomization confidence-set inversion · Constant-effect Fisher inversion 对每个恒定个体效应候选补全潜在结果,以同一随机分配设计检验并保留未拒绝者,证明覆盖并用精确断点枚举处理离散端点。 保留未拒绝的候选。可复算终点是给出一张“分配、概率、统计量、是否进入尾部”的完整表;只报一个 p 值会丢失设计本身。
参考资料