“每一项要求都已满足”与“至少找到一项成功”是两种不同的声明。前一种声明只有在所有检查通过时才出现;只要仍有一项要求实际上不满足,误报全部成功就必然包含对这一项的误报。交并检验把这条逻辑变成统一的错误概率保证。
形式陈述
并起来的原假设,交起来的拒绝域
给定统计模型{ P θ : θ ∈ Θ } 和预先确定的有限集合A 1 , … , A m ⊆ Θ ,m ≥ 1 。所检验的总体假设是
(1) H 0 : θ ∈ A := ⋃ i = 1 m A i , H 1 : θ ∈ A c = ⋂ i = 1 m A i c . 每个分量原假设都为假,才属于总体备择。设对H 0 i : θ ∈ A i 已经有level-$\alpha$检验 理路 统计假设检验 Statistical hypothesis test · Test function 在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。 的拒绝事件R i ,即
sup θ ∈ A i P θ ( R i ) ≤ α , 0 < α < 1. 交并检验在
(2) R = ⋂ i = 1 m R i 发生时才拒绝总体H 0 。则
(3) sup θ ∈ A P θ ( R ) ≤ α . 各分量统计量可以来自同一批数据,也可以任意依赖。每项使用水平α ,不必改为α / m 。
p值接口
若p i ( X ) 是对A i 统一有效的p值 理路 p 值 p-value 在零假设下校准的证据统计量,其小值事件的概率不超过对应阈值。 ,则
(4) p I U T ( X ) = max 1 ≤ i ≤ m p i ( X ) 是对并原假设A 有效的p值。采用p < α 拒绝时,式(4)恰好要求所有p i < α ;若采用p ≤ α ,各处同时换成非严格约定即可。离散模型中,临界相等的处理会改变具体拒绝集合。
若各分量只有level-α i 保证,相同交拒绝法给总体level-max i α i ,一般不能声称level-min i α i 。
直觉
证明只需找出一个真实分量
固定任意θ ∈ A ,至少存在一个i 使θ ∈ A i 。由R ⊆ R i ,
P θ ( R ) ≤ P θ ( R i ) ≤ α . 再对θ ∈ A 取上确界便得式(3)。被选中的i 可以随真实参数变化;它只用于证明,不是看数据后挑选一个方便检验。整个论证没有把概率相加,也没有将概率相乘,所以无需独立性。
同理,对任意u ∈ [ 0 , 1 ] ,
P θ { max j p j ≤ u } ≤ P θ { p i ≤ u } ≤ u , 证明式(4)的超均匀性。每个p i 只需在自己的A i 上有效,不要求它在别的分量原假设成立时也均匀。
与多重错误控制的逻辑分界
如果目标改成“只要某项拒绝,就宣布发现”,拒绝域变成⋃ i R i 。包含关系的方向变了:一个真实分量的level控制不能再包住这个并集。比如两个独立均匀p值都在真原假设下,
P { min ( p 1 , p 2 ) < α } = 1 − ( 1 − α ) 2 > α . α = 0.05 时是0.0975 。交并原理不取消族错误控制 理路 多重检验与族错误率 Multiple testing · Familywise error rate · FWER 同时检验多个假设时至少一次错误拒绝的概率及其 Bonferroni、Holm 控制。 ;它规定的是另一种总体声明。若运行许多IUT,再挑至少一个通过者报告,外层仍需处理多重性。
随机化也要规定怎么共同使用
若分量检验函数为φ i ( X ) ∈ [ 0 , 1 ] ,可以定义φ ( X ) = min i φ i ( X ) 。用同一个独立均匀随机数决定各分量是否拒绝,全部拒绝的条件概率正是这个最小值;因φ ≤ φ i ,同一level证明成立。
若改用相互独立的随机币,全部拒绝的条件概率为∏ i φ i ( X ) ,仍不超过每个分量,但与最小值程序一般有不同功效。只给几项随机化概率而不交代联合随机机制,尚未指定唯一的总体程序。
例子与边界
两个二值检查,不要求它们独立
观察( X 1 , X 2 ) ∈ { 0 , 1 } 2 ,其边缘成功概率为p 1 , p 2 ,允许任何相容联合分布。要支持“两个边缘概率都大于1 / 4 ”,原假设是
或 H 0 : p 1 ≤ 1 / 4 或 p 2 ≤ 1 / 4. 每个分量在X i = 1 时拒绝,level为1 / 4 ;总体只在( 1 , 1 ) 时拒绝,故
P ( X 1 = X 2 = 1 ) ≤ min ( p 1 , p 2 ) ≤ 1 / 4 对整个总体原假设成立。取p 1 = 1 / 4 , p 2 = 1 ,总体拒绝概率恰为1 / 4 ,所以这个模型类上的size确为1 / 4 。
若两个边缘都固定为1 / 4 ,独立联合律的总体拒绝率为1 / 16 ,完全共用一枚Bernoulli硬币时为1 / 4 ,把两份成功放在互斥事件时为0。这些程序都满足相同level,依赖结构仍会显著改变具体拒绝概率。
size可以小于名义水平
把分量原假设设为相同的整个模型类,并在一个均匀变量U 上取R 1 = { U < α } 、R 2 = { U > 1 − α } ,其中0 < α < 1 / 2 。各分量size都为α ,交集却为空,总体size为0。原理给的是上界,不保证取得等号,也不保证任何备择上的功效。
对于有实际备择的离散例,双单侧等效性检验 理路 等效性检验与双单侧TOST Equivalence test · Two one-sided tests · TOST · 双单侧等效检验 将预设等效区间外的复合零假设拆成两个单侧检验,证明无需Bonferroni的整体校准、等尾区间包含规则与共享尺度下的真实功效。 可在二项成功率上只拒绝一个中间计数。名义5 % 与该中间计数在两侧原假设下的最大概率可以严格不同,终点会把这两者分别算出。
删除失败分量会改变问题
若预先要求三个质量指标全部合格,看到第三项未通过后删掉它,再用前两项声明“全部合格”,拒绝事件已经改变。原证明需要至少一个真实的未满足要求仍在被检验列表中;事后删除它没有这个保证。可以明确报告较窄的新目标,但其选择过程需要重新校准。
相反,即使只有一项分量原假设为真,原来的交并保证仍成立。不能只在“所有分量都为真”的交集原假设上检查size,然后将结果扩大到式(1)的整个并集。
推论与应用
TOST 理路 等效性检验与双单侧TOST Equivalence test · Two one-sided tests · TOST · 双单侧等效检验 将预设等效区间外的复合零假设拆成两个单侧检验,证明无需Bonferroni的整体校准、等尾区间包含规则与共享尺度下的真实功效。 把“参数在下界之上且在上界之下”写成两个必须同时满足的要求。更多预设端点都需等效时,可继续对其总体声明取交;两层交仍是对所有必要分量全部拒绝。
给定m 个已经校准的p值,计算式(4)需要O ( m ) 比较和O ( 1 ) 额外工作空间,若需要完整报告则另外保存m 项。原始数据到每个p值的计算、复合原假设上的最坏情形校准,不包含在这个简单比较成本里。
实际输出应记录每个分量假设、对应p值、边界约定和最后的总体声明。某一分量未通过,只表示当前规则没有证据支持所有要求共同满足;它不证明这一分量真实失败,更不把“未检出差异”改成“已经等效”。
参考资料
Roger L. Berger、Jason C. Hsu,Bioequivalence Trials, Intersection-Union Tests, and Equivalence Confidence Sets ,Statistical Science11(4),1996,pp.283–302,DOI 。1995作者预印本§3 Theorems1–2、§4.1与§5.2说明IUT、size与等尾区间的责任。
George Casella、Roger L. Berger,Statistical Inference ,第2版,2002,Ch.8,交并与并交检验。本文有限level与max-p结论直接由事件包含证明,随机化机制与二值依赖例在正文逐项给出。