Skip to content

算法Algorithm

Benjamini–Yekutieli 调和修正

Benjamini–Yekutieli procedure · BY procedure · Benjamini-Yekutieli correction

对边缘有效且任意依赖的 p 值使用调和收缩阈值,以分段尾预算证明 FDR 控制,并由阶梯校准器连接 e-BH。

有效的单项 p 值允许任意依赖时,普通 BH 仍可能超出目标 FDR。Benjamini–Yekutieli(BY)不估计相关矩阵,而是把整条 BH 阈值压低一个调和因子。这个因子不是经验安全系数:它可以从随机拒绝数所对应的不同证据区间逐项推出来。

形式陈述 ​

调和收缩阈值 ​

固定 m≥1 个假设,真零 p 值只需边缘超均匀。设

Hm=∑j=1m1j,c=qmHm,0<q<1.

将 p 值升序排序,取

k∗=max({k:p(k)≤kc}∪{0}),

拒绝前 k∗ 项。这就是在水平 q/Hm 运行BH。当 m=1 时 Hm=1,退化成原来的单项检验。

直觉

不把随机拒绝数当作常数 ​

记最终拒绝集为 R,大小为 R。对一个真零索引 i,它对 FDP 的贡献是

1{i∈R}R∨1.

将 (0,mc] 分成 m 段。若 Pi∈((j−1)c,jc] 且 i 被拒绝,必有 Pi≤cR,从而整数 R≥j。于是逐数据有

1{i∈R}R∨1≤g(Pi),g(p)=∑j=1m1j1{(j−1)c<p≤jc}.

在 p>mc 时 g(p)=0;在 p=0 时可设 g(0)=1,这个点在真零下概率为零。这个阶梯函数把“越靠近零可能配更小分母”的最坏情况逐段记下来。

令 F(u)=Pr(Pi≤u)。直接按区间取期望并作离散分部求和,得到

Eg(Pi)=∑j=1mF(jc)−F((j−1)c)j=F(mc)m+∑j=1m−1F(jc)j(j+1).

超均匀性给 F(jc)≤jc,所以

Eg(Pi)≤c+c∑j=1m−11j+1=cHm=qm.

对全部 m0 个真零求和便得

FDR≤qm0m≤q.

整段证明只用边缘分布函数的上界。不能直接声称每一小区间概率都不超过长度 c:超均匀分布可以在某段右端集中质量,那个说法并不成立。分部求和把增量换成累积概率,才真正用到了已有条件。

例子与边界

四项检验的逐秩比较 ​

例如 m=4,q=0.1,有 H4=25/12,因而 c=0.012。对排序 p 值 (0.01,0.02,0.04,0.20),阈值为 (0.012,0.024,0.036,0.048),最大通过秩为二。普通 BH 的阈值 (0.025,0.05,0.075,0.1) 会拒绝前三项。BY 在此少报一项,换来的是不必证明联合依赖结构。

普通 BH 失效的有限分布 ​

取两个全真的零假设、目标 q=0.2,让 p 值向量 (0.1,1)、(1,0.1)、(0.2,0.2) 各以概率 0.1 出现,剩余 0.7 取 (1,1)。每个边际在 0.1 以下的概率为 0.1,在 0.2 以下为 0.2,所以都是有效 p 值。

普通 BH 的阈值 (0.1,0.2) 在前三种结果下都拒绝。全真零时,只要有拒绝 FDP 就是一,故 FDR 为 0.3。BY 使用 H2=3/2,阈值降为 (1/15,2/15),这三种结果均不通过,FDR 为零。后一个数说明此例上的保守性,不意味着一般 FDR 都会降到零。

推论与应用

调整 p 值怎样计算 ​

若希望读者之后选择目标水平,BY 调整 p 值为

p~(j)=min{1,mink≥jmHmkp(k)}.

从最后一项向前维护后缀最小即可。在四项例中得到约 (0.083333,0.083333,0.111111,0.416667),与水平 0.1 拒绝前两项一致。未取后缀最小时,调整值可能不单调,也就不能正确编码步升规则。

排序成本 O(mlog⁡m),调和和、阈值扫描和后缀最小各需 O(m)。保存原索引与结果需 O(m) 空间。Hm 约随 log⁡m 增长,但实际检验应使用精确求和或足够精确的保守值,不应随手用 log⁡m 替代;后者通常偏小,放宽阈值的方向不安全。

一座通向 e-BH 的阶梯 ​

预先固定同一个 m,q,把上面的阶梯放大为

f(p)=mqg(p).

它非负、非增,曲线面积为

∫01f(p)dp=mq∑j=1mcj=mcHmq=1.

因此可积校准保证 Ei=f(Pi) 为 e 值。升序第 k 个 p 值若落在第 j 个阶梯区间,得到 e[k]=m/(qj)。e-BH 的比较 e[k]≥m/(qk) 正好等价于 j≤k,也就是 p(k)≤kc。在 p=0 取第一阶高度,仍保留这种阈值等价;在支撑之外取零。

于是 BY 可以理解为:先用一套与 m,q 对应的阶梯校准器,再做 e-BH。这个重述解释了调和预算,但不是任意 p 值都可以直接取倒数的许可,也不说明校准器可在看见结果后自由调参。

保证边界与迁移 ​

BY 的任意依赖结论仍依赖每个真零 p 值本来就有效。模型选择、可选停止、错误标准误或漏掉的检验家族,都不能靠一个 Hm 修复。目标 q 与家族应先明确,全部未被报告的检验也不能事后从 m 中扣除。

FDR 是错误比例的期望,不是单次 FDP 上界,更不是每个发现为假的概率。如果已经有直接构造的 e 值,e-BH 不需要这一调和修正;两种输入的有效性约束不同,不能只比较阈值就断言哪个方法必然更有功效。

自测。 对 m=3,q=0.11,H3=11/6,得到 c=0.02。p 值 (0.025,0.035,0.9) 的第一秩失败、第二秩通过、第三秩失败,最终仍拒绝前两项。这再次检验“取最大通过秩”,而非遇到失败便停止。

参考资料
关系图谱5 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系