Skip to content

方法Method

闭合检验的同时 FDP 上界

Simultaneous FDP bounds · True discovery guarantee · Post hoc FDP bound

保留闭合检验尚未排除的子集,以其最大大小约束任意事后报告集的错误发现数,并用同一个高概率事件证明全体集合同时有效。

看完一批结果以后,研究者常想按效果大小、成本或空间位置重选一组值得跟进的候选。普通 FDR 程序保证的是它自己产出的集合;随意删改这个集合,错误比例可能上升。另一种交付方式是:允许选择任何集合,同时给每个集合一张错误数量上界。

这里的“同时”是整项保证的关键。不是对一个固定集合有效,再把它套到事后挑出的集合;而是在同一个概率至少为 1−α 的事件上,所有集合的上界一起成立。

形式陈述 ​

保留未被排除的子集 ​

沿用闭合检验的 m 个原假设。设 Xα 是已被闭合拒绝的非空索引集。对任意想报告的 R⊆[m],定义

tα(R)=max({|I|:I⊆R,I≠∅,I∉Xα}∪{0}).

它是 R 内“全部都可能是真零”的未排除子集的最大大小。额外加入零,使全部非空子集均被排除时结果为零,也使 tα(∅)=0。

由此报告

V(R)=|R∩I0|≤tα(R),FDP(R)≤tα(R)|R|∨1,

以及真发现数至少为 |R|−tα(R)。这里“真发现”指被报告的假设中实际为假的零假设;它不是说那些条目逐个都已经得到确认。

直觉

同一个事件保护所有选择 ​

若全部零假设都为假,即 I0=∅,错误数恒为零。否则考虑事件

A={对真实交集 HI0 的局部检验不拒绝}.

局部有效性给出 P(A)≥1−α。在 A 上,闭合规则不可能拒绝任何非空 I⊆I0,因为它们的上层检查都要经过 I0。

现在固定一份数据,并假设它落在 A 内。对任意报告集 R,若 R∩I0 非空,它就是 R 的一个未拒绝子集;因此其大小不超过定义中的最大值。若它为空,不等式直接成立。于是

P{∀R⊆[m]:|R∩I0|≤tα(R)}≥1−α.

证明中的“任意”是在同一份数据、同一个事件内部使用的,所以之后可以令 R 依赖观测结果。没有再对 2m 个报告集合分摊一次错误预算。

这不是参数的后验概率,也不表示本次上界一定正确。它说按这一完整规则重复实验时,所有集合一起获得正确上界的概率至少为 1−α。

例子与边界

无法认出哪一项,却能确认至少两项 ​

取三个零假设,各有 e 值 E1,E2,E3。额外假设:对每个交集 HI,其中相关 e 值在该交集的每个零模型下相互独立。因此乘积合并给出合法局部证据

EI=∏i∈IEi.

在 α=0.05 时用阈值二十。某次观察到 (E1,E2,E3)=(6,6,6):

子集大小 局部乘积 局部/闭合拒绝
1 6 所有单项都不拒绝
2 36 所有二元交集都拒绝
3 216 三元交集拒绝

二元交集上面只剩三元交集,它也通过,所以二元拒绝确实是闭合拒绝。单项仍因自身证据不足而失败。

对 R={1,2,3},最大未拒绝子集只有一个元素,故 tα(R)=1:三项合起来至少有两个真发现,FDP 上界为 1/3。对任意二元报告集,上界仍为一,FDP 上界为 1/2。对单个条目,上界是一,无法保证它为真发现。

交集信息能计数而未必定位

这个结果不矛盾:“至少两个是真的信号”没有指定哪两个。若把它写成“前两项均可靠”,就添加了证明没有给出的定位信息。

依赖条件必须留在交集检验里 ​

上例的独立性是局部乘积合法的条件。如果三个 e 值始终相同,并以概率 1/6 共同取六,其余取零,那么每项边际均值仍为一,但二元乘积均值为六。全真零时,以概率 1/6 就会出现表中情形并错误宣称至少两个信号,超过 0.05。

遇到任意依赖可以换用平均 e 值或 Bonferroni 局部 p 检验,再执行同一套闭合与上界算法。同时保证的逻辑仍成立,但发现能力可能不同。不能保留独立乘积的好看数字而删去它的条件。

推论与应用

对照 FDR:期望与同时高概率 ​

普通 FDR 控制 E[V(R)/(|R|∨1)],针对给定程序的输出 R。本页则控制一次覆盖事件,产出一张随集合而变的随机上界。它既不宣称每个集合 FDP 都小,也不在所有集合上给同一个数值阈值。

若目标是选一个 FDP 不超过 γ 的集合,可以在看完数据后寻找满足

tα(R)≤γ|R|

的 R,再结合成本、效应等偏好选择。由共同事件立刻得到 P{FDP(R)≤γ}≥1−α。但是允许的集合可能只有空集,保证不会凭空创造有功效的发现。

固定 α 也是流程的一部分。事后再从很多置信水平中挑一个最漂亮的报告,需要核对是否有跨水平共同保证;本页只证明预先指定水平下的集合同时性。

小规模枚举与子集最大值变换 ​

先以闭合页的 O(m2m) 递推得到所有闭合指示 c(I)。初始化

a(I)={|I|,c(I)=0,0,c(I)=1,a(∅)=0.

依次处理元素 j=1,…,m;对每个包含 j 的集合 R,更新

a(R)←max{a(R),a(R∖{j})}.

处理完前 j 个元素时,a(R) 已经考虑从 R 中任意删去这些元素得到的子集。对 j 归纳后,最终值正是所有 I⊆R 的初始值最大值,也就是 tα(R)。这避免逐个 R 再枚举全部子集的 3m 代价;时间仍为 O(m2m),存储 O(2m),并没有变成适合上万个假设的通用算法。

输出时可同时保存一个达到最大值的未拒绝子集作为见证。它不是“这些项已经被证明为真零”,而是解释当前规则为何无法把上界再缩小。

自测。 上例选择 R={1,2},再因第一项更便宜而只留下 {1}。二元集的 FDP 上界为 1/2,单项集的上界变成一。删掉一项会减少错误数的可能值,却可能提高错误比例;因此过滤后的比例不能沿用过滤前的数字。

参考资料
  • Jelle J. Goeman and Aldo Solari, Multiple Testing for Exploratory Research, 2011,arXiv:1208.2841v2,§2 “Non-consonant closed testing”、式(1)与 Table 1:从未闭合拒绝子集构造同时错误数上界。本文 6,6,6 乘积例和子集最大值算法单独展开核验。
  • Vladimir Vovk and Ruodu Wang, Confidence and discoveries with e-values, Statistical Science, 2023,e 值交集检验与发现数量保证的联系。本文不假定该文的专用计算捷径。
关系图谱4 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系