只检验“效应为零”给出一个决定,却没有说明哪些效应大小还与实验相容。反演的做法是逐个试候选:假如每个人都增加 δ ,能否补出一张与抽签结果相容的表?保留下来的候选组成置信集合,其形状由整套检验决定。
形式陈述
每个候选都必须是一份尖锐假设
固定有限单位和已知分配设计,观察 z o b s , Y o b s 。本页模型假设存在共同常数 δ ∗ ,使
对 每 个 Y i ( 1 ) − Y i ( 0 ) = δ ∗ 对每个 i . 对候选 δ 检验尖锐假设 H δ ,补全
b i ( δ ) = Y i o b s − z i o b s δ , Y i δ ( 0 ) = b i ( δ ) , Y i δ ( 1 ) = b i ( δ ) + δ . 每个允许分配都按此表重新生成观测,并使用尖锐随机化检验 理路 Fisher 尖锐零假设随机化检验 Fisher randomization test · Sharp null randomization test 把潜在结果固定、处理分配作为唯一随机源,在尖锐零假设下补全反事实,按已知分配概率计算加权尾部,并辨明平均效应零假设的边界。 产生 p 值 p δ 。在水平 α 采用 p δ ≤ α 拒绝,定义
C α = { δ ∈ R : p δ > α } . 于是 Pr δ ∗ ( δ ∗ ∈ C α ) ≥ 1 − α ,概率对真实实验的分配取。接受集合不应先被强制写成一个区间;端点是否保留,也须逐点按严格不等号判断。
直觉
只在真实候选处使用一次错误率保证
当 δ = δ ∗ ,补全得到的基线 b i ( δ ∗ ) = Y i ( 0 ) 与实际抽签无关,因此 Fisher 校准适用。漏掉真值当且仅当 p δ ∗ ≤ α ,故
Pr ( δ ∗ ∉ C α ) = Pr ( p δ ∗ ≤ α ) ≤ α . 这正是检验与置信集合对偶 理路 置信集合与检验的对偶 Confidence set and test duality · Test inversion 逐参数反演 level 检验得到覆盖置信集合,并由置信集合反构造点零假设检验。 。虽然计算时尝试无穷多个候选,覆盖证明没有对它们作并集界:真实效应只有一个,漏掉它只对应一个检验。
若每份分配都含两种处理,记组均值差算子为 D ( y , z ) 。可采用候选中心化统计量
| D ( Y δ ( z ) , z ) − δ | = | D ( b ( δ ) , z ) | . 实际分配处它等于 | D ( Y o b s , z o b s ) − δ | 。这说明可以在扣除候选效应后的固定基线表上重分配。不能只把观察均值差减去 δ ,却继续使用零效应时未更新的参考分布。
例子与边界
四人实验得到一段闭合接受集合
四人中等概率选两人处理,实际处理组为1、2,观察结果为 ( 3 , 4 , 1 , 2 ) 。候选效应扣除后的基线表是
( 3 − δ , 4 − δ , 1 , 2 ) . 六份处理组分别为12、13、14、23、24、34,对应基线均值差为
2 − δ , − 1 , 0 , 0 , 1 , δ − 2. 所以双侧绝对差检验的 p 值恰为
p δ = 2 + 2 1 { | 2 − δ | ≤ 1 } + 2 1 { | 2 − δ | = 0 } 6 . 取 α = 1 / 3 :当 δ < 1 或 δ > 3 时,p 值为 1 / 3 ,被拒绝;在 [ 1 , 3 ] 内除二以外为 2 / 3 ;在二处为一。接受集合因此为 [ 1 , 3 ] 。两个端点的并列项必须计入,不能由邻近网格值猜测端点开闭。
这是至少 2 / 3 覆盖的教学程序,不是 95 % 区间。若取 α = 0.05 ,本例所有候选的 p 值均至少为 1 / 3 ,接受集合就是整个实轴。精确校准可能很宽,不能为了给出有限端点而删掉离散概率。
图片加载失败 空心点标出不能沿用邻近水平的断点;实心点是候选恰好等于该值时重新计入并列得到的结果。若只用稀疏网格连线,就会把这项端点信息丢掉。
在真实表上核对覆盖
设真实基线为 ( 1 , 2 , 1 , 2 ) 、每人效应为二,刚才的观察确实可能由处理组12产生。在六份分配中,基线差为 0 , − 1 , 0 , 0 , 1 , 0 。真候选二的 p 值,在两份极端分配上为 1 / 3 ,其余四份为一。
因此上述 α = 1 / 3 反演程序恰以 4 / 6 = 2 / 3 的概率保留真效应。这里是在固定同一完整表后改变抽签,不是在看见一份数据后给参数分配概率。
异质平均效应不是这里的参数
若各人的效应不同,可能根本不存在满足全部等式的 δ ∗ 。这时不能把 C α 改名为“平均效应的精确置信区间”。即使某个候选等于实际平均效应,候选补全表也通常不是实际潜在结果表,覆盖证明的关键一步已经失效。
不同的单侧/双侧排序、统计量和并列约定也会给不同接受集合。一般反演可有多个连通分支;取最小和最大端点之间的凸包会扩张覆盖,却改变与原检验逐点等价的集合。
推论与应用
用断点求全部候选,而不是任意截断网格
在固定人数的有限设计、均值差统计量下,对每个分配 z 都有
D ( b ( δ ) , z ) = a z + b z δ . 尾部成员关系仅在 | a z + b z δ | = | a o + b o δ | 处改变,下标 o 表示实际分配。将平方差分解为两个线性因子,即解
a z + b z δ = ± ( a o + b o δ ) . 每份分配至多贡献两个有限断点;恒等的因子单独处理,不产生无限断点列表。排序全部断点后,在各开区间取一个代表值计算 p 值,并在每个断点重新比较并列项。最后按 p > α 合并所保留的区间和孤立点,也要检查两端无界区间。
设分配数为 M ,预计算系数的朴素成本为 O ( M N ) 。至多 2 M 个断点需 O ( M log M ) 次排序比较;对每段重新扫描全部分配的直观算法需 O ( M 2 ) 次算术,存储 O ( M ) 。这些是算术操作数;有理精确数的位长成本另计。更快的扫描需维护每个断点的尾部权重变化,不能仅凭“排序后线性”省略这一实现。
读者的交付应包含候选模型、尾部定义、设计权重、所有断点及其开闭。计算网格可用于画图,却不能独立证明某两个网格点之间没有漏掉分支,也不能证明集合有界。
参考资料
Peng Ding, A First Course in Causal Inference 作者公开稿 ,§3.6.1,其他尖锐假设与恒定效应反演;§8.1 对强零与弱零目标的区分。
Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses , 3rd ed., Springer, 2005,§3.5,检验反演的一般覆盖机制。本文六分配的 p 值函数、端点和覆盖枚举均由有限表独立推导,断点算法限定为本页的仿射均值差统计量。