“当目标从“避免任何错误发现”转向“控制错误发现所占比例”时,应使用FDR 与 Benjamini–Hochberg一类不同准则。置信区间的同时覆盖、ANOVA 后 planned contr…”
形式陈述 ​
令
错误发现率
没有拒绝时分母用一使 FDP 为零。FDR 是随机比例的期望,不是
BH 程序 ​
将有效p 值排序
若集合非空则拒绝前
在真实零 p 值独立且有效、并与其他 p 值满足标准独立条件时,
在 PRDS 等正依赖下仍有控制;任意依赖需 Benjamini–Yekutieli 调整等更保守方法。
直觉
BH 不要求每一次拒绝都正确,而是控制重复实验中“错误发现占全部发现的比例”的期望。排序阈值会随已接受的发现数放宽:证据很强的前几项可以为后续项提供更大的临界值,但整条阶梯仍由预先给定的
例子与边界
控制机制与 adjusted p 值 ​
独立情形把 FDR 分解为
将一个真实 p 值设为零并利用 step-up 的自洽性,可把每项界为
BH adjusted p 值从后向前计算:
后缀最小保证调整值单调。本例前三个均不超过
边界 ​
“FDR 10%”不表示本次三个发现中恰有 0.3 个错误,也不保证每次 FDP 不超过 10%。它是重复实验的期望准则,单次 FDP 可能很高。
负依赖、选择性过滤或经过数据依赖权重处理的 p 值可能破坏普通 BH 证明。过滤若独立或满足特定结构可安全使用,否则需联合校准。
无效的单项 p 值不会被 BH 修复。可选停止、模型选择和事后扩展发现集合都会改变输入或
FDR 与FWER不同:前者允许在发现多时容忍少量错误,后者控制任何错误发生。选择哪个准则应由损失和应用风险决定。
推论与应用
基因组、成像和大规模 A/B 指标常使用 BH。它与控制“至少一次错误”的FWER 方法回答不同风险问题;应用时应先选择与损失相符的错误准则,再核对 p 值有效性和依赖条件。
BH 的 self-consistency 可写为
扩展地图 ​
任意依赖下,Benjamini–Yekutieli 把阈值除以
Storey 方法估计
online FDR 处理按时间到达的假设,阈值
若目标是让单次实验的 FDP 以高概率不超过阈值,应改用 FDP tail control 或 simultaneous FDP bounds。它们控制的对象比期望 FDR 更强,通常也会牺牲发现数,不能作为普通 BH 的同义改写。
参考资料
- Yoav Benjamini and Yosef Hochberg, “Controlling the False Discovery Rate,” JRSS B 57(1), 1995。
- Yoav Benjamini and Daniel Yekutieli, “The Control of the FDR under Dependency,” Annals of Statistics 29(4), 2001。
- Christopher Genovese and Larry Wasserman, “Operating Characteristics and Extensions of the FDR Procedure,” JRSS B 64(3), 2002。