Skip to content

方法Method

闭合检验原理

Closed testing principle · Closed testing procedure · 闭合多重检验

为每个交集零假设配备局部水平检验,只在所有上层交集都被拒绝后拒绝目标,以一个真零交集事件证明强族错误率控制。

三个指标分别给出 p=(0.01,0.04,0.20)。第二项小于 0.05,是否可以确认它有变化?闭合检验要求再问:若第二、第三项都没有变化,它们合起来是否已经出现足够证据?如果这个更大的零假设仍说得通,单独确认第二项就要暂缓。

“闭合”指先把原假设族补齐为所有非空交集,再让每个结论通过相关交集的检查。不同交集可以用不同统计方法;共同接口只有一个:在该交集为真时,它自己的误拒概率不超过指定水平。

形式陈述 ​

局部拒绝与闭合拒绝 ​

固定有限假设 H1,…,Hm,将每个 Hi 看作一组数据分布。对非空索引集 I⊆[m],定义

HI=⋂i∈IHi.

例如 H{1,3} 表示第一和第三个零假设同时成立。对每个 I 事先指定局部检验 ϕI(X)∈{0,1},并证明

supP∈HIP(ϕI=1)≤α.

局部检验的 ϕI=1 只是该节点独自通过,尚未完成多重校准。闭合拒绝指示量定义为

ϕIcl=minJ⊇IϕJ.

也就是说,I 本身及包含它的所有交集索引都必须局部拒绝。最终若 ϕ{i}cl=1,才确认拒绝原假设 Hi。

索引包含方向容易看反:J⊇I 时,条件更多,分布集合反而是 HJ⊆HI。图中的“上层”按索引规模排列,不是在说它包含更多分布。空交集不参加检验;若某个交集逻辑上不可能成立,可把其局部检验设为恒拒绝,但需要先证明这项逻辑不相容。

局部拒绝与闭合拒绝分开核验
直觉

强控制为什么只花一次 alpha ​

固定真实分布 P,令 I0={i:P∈Hi}。这就是未知的全部真零索引。若 I0 为空,不可能有错误拒绝。否则 HI0 是一个真实交集,因此

P(ϕI0=1)≤α.

在事件 {ϕI0=0} 上,每个真零 i∈I0 的闭合检查都包含 I0 这个节点,所以它们全部被挡住。于是

{至少错误拒绝一个原假设}⊆{ϕI0=1}.

取概率便得强 FWER不超过 α。同一推理还保护所有真实交集:若非空 I⊆I0,其上层仍包含 I0,也不能被闭合拒绝。

证明没有把 2m−1 个局部错误事件相加。无论实际真假组合是什么,全部错误都要经过“所有真零共同组成的那个交集”。局部检验可以互相依赖,也可以共享全部数据;关键是每一个都在自己的零模型下真正有效。

例子与边界

三个 p 值逐节点计算 ​

对每个交集使用 Bonferroni 局部p 值

pI=min{1, |I|mini∈Ipi}.

在 HI 下所有成员 p 值均有效,已有 FWER 页的并集界证明它有效,不要求独立。对 p=(0.01,0.04,0.20)、α=0.05,完整记录如下:

索引 I 局部 pI 局部拒绝 闭合拒绝
{1,2,3} 0.03 是 是
{1,2} 0.02 是 是
{1,3} 0.02 是 是
{2,3} 0.08 否 否
{1} 0.01 是 是
{2} 0.04 是 否
{3} 0.20 否 否

第二项被 p{2,3}=0.08 阻挡,第一项则通过四个相关节点。若局部检验都由 p 值编码,闭合调整值为

pIcl=maxJ⊇IpJ.

本例单项调整值为 (0.03,0.08,0.20)。先给定水平再比较调整值,与逐个节点检查完全一致。

用 Bonferroni 作局部检验时,这个闭合程序恰可由已有的Holm 步降算法实现,不必枚举全部子集。那是利用了特定局部检验结构的捷径;换成别的局部检验后,不能仍照搬 Holm 阈值。

一个只检查全局零假设的失败方案 ​

有人先检验 H[m],通过后就对每项单独用水平 α。当全局零假设真时,它有弱控制;部分假设为假时,全局检验可能几乎总拒绝,留下的多个真零便失去联合保护。

取三项,第一项实际有极强信号,使全局检验总能通过;第二、第三项为真零,且其 p 值独立均匀。后两项至少一个小于 0.05 的概率为 1−0.952=0.0975。只放一个全局“门卫”,缺少的正是 H{2,3} 这一道检查。

闭合也不能修复无效局部检验。如果一个交集使用了需要独立的合并检验,而成员实际任意依赖,统一的 α 标签就没有成立依据。

推论与应用

从指数定义得到可执行算法 ​

一般闭合族有 2m−1 个节点,局部检验的计算成本首先就可能指数增长。已有全部局部布尔值时,不必为每个 I 再枚举所有上集。令 c([m])=ϕ[m],按集合大小从大到小计算

c(I)=ϕI ∧⋀j∉Ic(I∪{j}).

归纳说明每个更大上集都沿某条单元素添加路径被检查,故 c(I)=ϕIcl。这一步需要 O(m2m) 次布尔运算和 O(2m) 存储,另加所有局部检验的成本。调整 p 值版本把逻辑与换成最大值即可。

当 m 很大时,需要利用局部检验的对称性、逻辑约束或专门捷径;不能把写得紧凑的子集公式称为多项式算法。输出应保存所用局部检验规则和阻挡节点,使未拒绝也有可检查原因。

交集结论还可以用来数发现 ​

一个交集被拒绝,只保证其中至少一个零假设为假,未必识别是哪一个。因此可能出现“所有单项都无法确认,但至少有若干项是真的信号”。同时 FDP 上界保留这些交集信息,在看完数据后选出报告集合,仍能给错误发现数量的共同上界。

自测。 在本例中只将第三项从 0.20 改成 0.01。所有二元交集的 Bonferroni p 值都不超过 0.02,三元交集为 0.03;第二项自身为 0.04,于是三个单项均通过闭合。改变一项数据会解除另一项的阻挡,但强控制证明仍按真实 I0 统一成立。

参考资料
关系图谱4 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

使用的工具