Skip to content

多重检验与族错误率

Multiple testing · Familywise error rate · FWER

同时检验多个假设时至少一次错误拒绝的概率及其 Bonferroni、Holm 控制。

定义

同时检验 m 个零假设。设 I0 为真实零假设索引,拒绝集合为 R。族错误率为

FWER=P(RI0),

即至少一个第一类错误的概率。强控制要求对每个真假配置都不超过 α;弱控制只在所有零假设都真时控制。

Bonferroni

若每个 p 值在自身零假设下有效,以 piα/m 拒绝。由并集界

P(iI0:piα/m)iI0α/mα.

它不要求 p 值独立,因此稳健但可能保守。

Holm 步降法

排序 p(1)p(m)。从最小开始,依次与 α/(mj+1) 比较;首次不通过时停止并保留其后全部假设。Holm 在任意依赖下强控制 FWER,且逐数据至少不比单步 Bonferroni 少拒绝。

例子

m=4,α=0.05,排序 p 值为 (0.008,0.015,0.030,0.20)。Holm 阈值依次为 (0.0125,0.0167,0.025,0.05),前两项拒绝,第三项失败后停止。Bonferroni 只会拒绝第一项。

调整 p 值与保证来源

Holm 的强控制可以直接从第一个被拒绝的真实零假设看出。设真实零假设共有 m0 个,排序中第一个真实零假设位于第 j 位;在它之前至多有 j1 个假零,因此

mj+1m0.

若 Holm 错误拒绝这个假设,就必有某个真实 p 值不超过 α/(mj+1)α/m0。于是

P(至少错误拒绝一个真零)P(miniI0piαm0)iI0αm0=α.

推导只使用每个真零假设下 p 值的有效性与并集界,没有使用 p 值之间的独立性。这也是“强控制”覆盖任意真假配置的关键,而不只是所有零假设都真时的弱控制。

Holm adjusted p 值为

p~(j)=maxij(mi+1)p(i)1.

例中得到约 (0.032,0.045,0.060,0.20)。前缀最大确保调整值按秩不下降,与逐步停止规则完全对应;在给定家族水平 α 下,拒绝调整值不超过 α 的假设,与逐步比较得到同一结论。

若预先给权重 wi0,iwi=1,weighted Bonferroni 用阈值 αwi,同样由并集界控制。权重若看见对应 p 值后才决定,就不再是同一证明。

Holm 还可从闭合检验理解:对每个交集零假设使用 Bonferroni 局部检验,只有当所有包含 Hi 的相关交集都被拒绝时才拒绝 Hi。Holm 的 step-down 顺序把这组指数多个交集判断压缩成排序阈值;因此它不是任意挑出的一串分母,而是闭合原则在这组局部检验下的高效实现。

家族、依赖与相邻错误准则

逐项 0.05 检验不能控制族错误;若 m 个零假设全真且检验独立,FWER 为 10.95m,在 m=20 时约为 0.642。这个增长来自“至少一次错误”事件的累积,不表示任何单个 p 值本身失效。Bonferroni 和 Holm 的任意依赖保证来自并集界;不是因为它们暗中假设了独立。

family 必须由科学问题和选择流程共同界定。只在每张表内部校准,却跨表寻找最小 p 值,整体选择仍未受控;事后删去不显著检验,再把剩余数量当成原始 m,也会改变所分析的错误事件。预筛选、分层检验或 alpha 转移可以有效,但规则及其条件必须在看到对应证据之前固定。

FWER 与错误发现率(FDR)回答不同问题。FWER 控制“至少一个真零假设被拒绝”的概率,适合不能容忍任何确认性错误的家族;FDR 控制错误拒绝在全部拒绝中的期望比例,允许以不同错误标准换取更多发现。不能把一个 FDR 程序的数值阈值解释成 FWER 保证。

同一并集界也能校准同时置信区间:若每个坐标使用边缘覆盖率 1α/m,全部区间同时覆盖的概率至少为 1α。逐项普通 95% 区间只保证各自覆盖,不自动给整组区间 95% 的联合覆盖;这里改变的是覆盖事件,逻辑与 FWER 中“至少一个错误”完全对应。

利用联合依赖结构的重采样 step-down、Hochberg step-up 或闭合检验有时比 Holm 更有功效,但它们各自需要联合零分布、正依赖或局部交集检验等条件。本页的 Bonferroni/Holm 结论不依赖这些额外结构,也不能反过来替这些方法提供保证。

多重程序只能继承输入 p 值的有效性。若单项模型、标准误或抽样机制已经使 p 值偏小,Bonferroni 与 Holm 不会修复这一层错误;它们控制的是由多个有效单项检验组成的家族,而不是数据分析全过程中的所有偏差。

参考资料
  • Sture Holm, “A Simple Sequentially Rejective Multiple Test Procedure,” Scandinavian Journal of Statistics 6, 1979。
  • Peter H. Westfall and S. Stanley Young, Resampling-Based Multiple Testing, Wiley, 1993。
  • Joseph P. Romano, Azeem Shaikh, and Michael Wolf, “Control of the False Discovery Rate under Dependence,” 2008。