有效的单项 p 值允许任意依赖时,普通 BH 仍可能超出目标 FDR。Benjamini–Yekutieli(BY)不估计相关矩阵,而是把整条 BH 阈值压低一个调和因子。这个因子不是经验安全系数:它可以从随机拒绝数所对应的不同证据区间逐项推出来。
形式陈述
调和收缩阈值
固定 个假设,真零 p 值只需边缘超均匀。设
将 p 值升序排序,取
拒绝前 项。这就是在水平 运行BH理路错误发现率与 Benjamini–HochbergFalse discovery rate · Benjamini–Hochberg procedure · FDR控制错误拒绝占全部拒绝比例期望的多重检验准则与步升程序。。当 时 ,退化成原来的单项检验。
直觉
不把随机拒绝数当作常数
记最终拒绝集为 ,大小为 。对一个真零索引 ,它对 FDP 的贡献是
将 分成 段。若 且 被拒绝,必有 ,从而整数 。于是逐数据有
在 时 ;在 时可设 ,这个点在真零下概率为零。这个阶梯函数把“越靠近零可能配更小分母”的最坏情况逐段记下来。
令 。直接按区间取期望并作离散分部求和,得到
超均匀性给 ,所以
对全部 个真零求和便得
整段证明只用边缘分布函数的上界。不能直接声称每一小区间概率都不超过长度 :超均匀分布可以在某段右端集中质量,那个说法并不成立。分部求和把增量换成累积概率,才真正用到了已有条件。
例子与边界
四项检验的逐秩比较
例如 ,有 ,因而 。对排序 p 值 ,阈值为 ,最大通过秩为二。普通 BH 的阈值 会拒绝前三项。BY 在此少报一项,换来的是不必证明联合依赖结构。
普通 BH 失效的有限分布
取两个全真的零假设、目标 ,让 p 值向量 、、 各以概率 出现,剩余 取 。每个边际在 以下的概率为 ,在 以下为 ,所以都是有效 p 值。
普通 BH 的阈值 在前三种结果下都拒绝。全真零时,只要有拒绝 FDP 就是一,故 FDR 为 。BY 使用 ,阈值降为 ,这三种结果均不通过,FDR 为零。后一个数说明此例上的保守性,不意味着一般 FDR 都会降到零。
推论与应用
调整 p 值怎样计算
若希望读者之后选择目标水平,BY 调整 p 值为
从最后一项向前维护后缀最小即可。在四项例中得到约 ,与水平 拒绝前两项一致。未取后缀最小时,调整值可能不单调,也就不能正确编码步升规则。
排序成本 ,调和和、阈值扫描和后缀最小各需 。保存原索引与结果需 空间。 约随 增长,但实际检验应使用精确求和或足够精确的保守值,不应随手用 替代;后者通常偏小,放宽阈值的方向不安全。
一座通向 e-BH 的阶梯
预先固定同一个 ,把上面的阶梯放大为
它非负、非增,曲线面积为
因此可积校准理路p 值到 e 值的可积校准p-to-e calibration · p-to-e calibrator · p-to-e 校准函数用非负单调且积分不超过一的函数把超均匀 p 值转成 e 值,证明校准条件并检查调参、分段与数值边界。保证 为 e 值。升序第 个 p 值若落在第 个阶梯区间,得到 。e-BH理路e-BH 与任意依赖的 FDR 控制e-BH procedure · e-Benjamini–Hochberg procedure · eBH按降序 e 值寻找最大自洽发现集合,用逐样本预算消去随机拒绝数,在任意依赖下控制 FDR,并核对过滤与停止的边界。 的比较 正好等价于 ,也就是 。在 取第一阶高度,仍保留这种阈值等价;在支撑之外取零。
于是 BY 可以理解为:先用一套与 对应的阶梯校准器,再做 e-BH。这个重述解释了调和预算,但不是任意 p 值都可以直接取倒数的许可,也不说明校准器可在看见结果后自由调参。
保证边界与迁移
BY 的任意依赖结论仍依赖每个真零 p 值本来就有效。模型选择、可选停止、错误标准误或漏掉的检验家族,都不能靠一个 修复。目标 与家族应先明确,全部未被报告的检验也不能事后从 中扣除。
FDR 是错误比例的期望,不是单次 FDP 上界,更不是每个发现为假的概率。如果已经有直接构造的 e 值,e-BH 不需要这一调和修正;两种输入的有效性约束不同,不能只比较阈值就断言哪个方法必然更有功效。
自测。 对 ,,得到 。p 值 的第一秩失败、第二秩通过、第三秩失败,最终仍拒绝前两项。这再次检验“取最大通过秩”,而非遇到失败便停止。
参考资料