定义 ​
令
错误发现率
没有拒绝时分母用一使 FDP 为零。FDR 是随机比例的期望,不是
BH 程序 ​
将 p 值排序
若集合非空则拒绝前
在真实零 p 值独立且有效、并与其他 p 值满足标准独立条件时,
在 PRDS 等正依赖下仍有控制;任意依赖需 Benjamini–Yekutieli 调整等更保守方法。
例子 ​
控制机制与 adjusted p 值 ​
独立情形把 FDR 分解为
将一个真实 p 值设为零并利用 step-up 的自洽性,可把每项界为
BH adjusted p 值从后向前计算:
后缀最小保证调整值单调。本例前三个均不超过
任意依赖下,Benjamini–Yekutieli 把阈值除以
边界 ​
“FDR 10%”不表示本次三个发现中恰有 0.3 个错误,也不保证每次 FDP 不超过 10%。它是重复实验的期望准则,单次 FDP 可能很高。
负依赖、选择性过滤或经过数据依赖权重处理的 p 值可能破坏普通 BH 证明。过滤若独立或满足特定结构可安全使用,否则需联合校准。
无效的单项 p 值不会被 BH 修复。可选停止、模型选择和事后扩展发现集合都会改变输入或
FDR 与FWER不同:前者允许在发现多时容忍少量错误,后者控制任何错误发生。选择哪个准则应由损失和应用风险决定。
应用 ​
基因组、成像和大规模 A/B 指标常使用 BH。加权 BH、分层 FDR 和 online FDR 需要各自的权重、信息时间与依赖条件。
BH 的 self-consistency 可写为
Storey 方法估计
online FDR 中假设按时间到达,阈值
若研究更关心每次实验 FDP 不超过阈值,可用 FDP tail control 或 simultaneous FDP bounds。它们比期望 FDR 强,通常牺牲发现数;准则必须匹配错误损失。
local false discovery rate
加权 BH 的权重通常要求非负、平均为一,并独立于对应 null p 值。用外部协变量学习权重可提高功效,但必须交叉拟合或满足 independent hypothesis weighting 条件。
参考资料
- Yoav Benjamini and Yosef Hochberg, “Controlling the False Discovery Rate,” JRSS B 57(1), 1995。
- Yoav Benjamini and Daniel Yekutieli, “The Control of the FDR under Dependency,” Annals of Statistics 29(4), 2001。
- Christopher Genovese and Larry Wasserman, “Operating Characteristics and Extensions of the FDR Procedure,” JRSS B 64(3), 2002。