“FDR 与FWER不同:前者允许在发现多时容忍少量错误,后者控制任何错误发生。选择哪个准则应由损失和应用风险决定。”
定义 ​
同时检验
即至少一个第一类错误的概率。强控制要求对每个真假配置都不超过
Bonferroni ​
若每个 p 值在自身零假设下有效,以
它不要求 p 值独立,因此稳健但可能保守。
Holm 步降法 ​
排序
例子 ​
调整 p 值与保证来源 ​
Holm 的强控制可以直接从第一个被拒绝的真实零假设看出。设真实零假设共有
若 Holm 错误拒绝这个假设,就必有某个真实 p 值不超过
推导只使用每个真零假设下 p 值的有效性与并集界,没有使用 p 值之间的独立性。这也是“强控制”覆盖任意真假配置的关键,而不只是所有零假设都真时的弱控制。
Holm adjusted p 值为
例中得到约
若预先给权重
Holm 还可从闭合检验理解:对每个交集零假设使用 Bonferroni 局部检验,只有当所有包含
家族、依赖与相邻错误准则 ​
逐项
family 必须由科学问题和选择流程共同界定。只在每张表内部校准,却跨表寻找最小 p 值,整体选择仍未受控;事后删去不显著检验,再把剩余数量当成原始
FWER 与错误发现率(FDR)回答不同问题。FWER 控制“至少一个真零假设被拒绝”的概率,适合不能容忍任何确认性错误的家族;FDR 控制错误拒绝在全部拒绝中的期望比例,允许以不同错误标准换取更多发现。不能把一个 FDR 程序的数值阈值解释成 FWER 保证。
同一并集界也能校准同时置信区间:若每个坐标使用边缘覆盖率
利用联合依赖结构的重采样 step-down、Hochberg step-up 或闭合检验有时比 Holm 更有功效,但它们各自需要联合零分布、正依赖或局部交集检验等条件。本页的 Bonferroni/Holm 结论不依赖这些额外结构,也不能反过来替这些方法提供保证。
多重程序只能继承输入 p 值的有效性。若单项模型、标准误或抽样机制已经使 p 值偏小,Bonferroni 与 Holm 不会修复这一层错误;它们控制的是由多个有效单项检验组成的家族,而不是数据分析全过程中的所有偏差。
参考资料
- Sture Holm, “A Simple Sequentially Rejective Multiple Test Procedure,” Scandinavian Journal of Statistics 6, 1979。
- Peter H. Westfall and S. Stanley Young, Resampling-Based Multiple Testing, Wiley, 1993。
- Joseph P. Romano, Azeem Shaikh, and Michael Wolf, “Control of the False Discovery Rate under Dependence,” 2008。