“因此可积校准保证 $E i=f(P i)$ 为 e 值。升序第 $k$ 个 p 值若落在第 $j$ 个阶梯区间,得到 $e {[k]}=m/(qj)$。e BH 的比较 $e {[k]}\g…”
五个假设给出证据
它与普通 BH 一样通过“最终发现数”设定阈值,但这里大 e 值表示强证据,排序方向是从大到小。保证的来源也不同:先在每份数据上给错误比例一个上界,再对它取期望。
形式陈述
输入、排序与最大通过秩
固定
将实现值降序排序为
若
直觉
把随机分母从证明里消掉
设输出集合为
只要
未拒绝时左侧是零,拒绝时第一步正是阈值条件,所以随机
这个证明不拆解联合概率、不条件于其他证据,也不假定独立或正相关。任意依赖的结论来自“每个真零单独付得起自己的预算”,而非依赖性从数据中消失了。
例子与边界
五项证据的最大通过秩
开头例的阈值为
如果临界位置有并列,不会发生任意拆开一个临界并列组的问题:若第
过滤发现集可以真的破坏 FDR
取
有活动真零证据时,排序为
如果发表时只保留编号一、二,删除第三项,输出就以概率
这也是为什么“删掉一些发现总会更保守”不适用于错误比例:删除的可能是真发现,分母下降得比错误数更快。若希望任意事后选择集合并获得高概率比例上界,应使用同时 FDP 保证。
推论与应用
自洽性还容许额外选择约束
上面的证明只用到:若
e-BH 是没有额外限制时最大的自洽集合。若一个集合
这是保留完整家族大小
固定 e 值、过程与拒绝记录
可以让每个输入来自一个合法 e-process 在同一有限停时的值,但该过程必须对包含全部相关信息的共同滤过保持停时有效性。仅对自己一条数据流有效,而停止规则还观察别的相关数据,不自动满足条件。
更重要的是,本页控制的是一次输出集合的 FDR。每天运行一次、把历次所有拒绝并在一起,不是本页证明的同一个集合;即使每次输入都合法,也没有自动得到“曾经拒绝过”的 FDR 保证。运行最大 e 值一般也不再满足均值一预算。
成本、转换与验证
标准实现排序需要
先用预定校准器把 p 值转为 e 值,再运行本程序也有效。反过来,形式上对
迁移自测。 把开头第三项由十七改成十六,前三个秩都失败,第四、五个秩也失败,所以发现数从三变成零。若把第三项提高到十八,则仍为三。这个跳变来自共同阈值的自洽条件,说明审计应保留全部比较值,而不是只报告前三项。
参考资料
- Ruodu Wang and Aaditya Ramdas, False discovery rate control with e-values, JRSS B 84(3), 822–852, 2022,§4.1 的 base e-BH,以及 §5 的自洽性、Proposition 2 与其证明;本文不采用需要附加分布信息的 boosting 步骤。
- Ruodu Wang, Elementary proofs of several results on false discovery rate, arXiv:2201.09350v3, 2025,§4、Theorem 3 和 Remark 2,逐样本预算证明。本文五项排序例与过滤失效的三项分布独立计算。