Skip to content

方法Method

p 值到 e 值的可积校准

p-to-e calibration · p-to-e calibrator · p-to-e 校准函数

用非负单调且积分不超过一的函数把超均匀 p 值转成 e 值,证明校准条件并检查调参、分段与数值边界。

若已经有一套可靠的 p 值分析,怎样把它接到允许任意依赖合并的 e 值程序?直接取倒数很诱人:p 越小,倒数越大。但均匀变量 U 的 1/U 具有无穷均值,无法满足 e 值的一元期望预算。需要一个增长稍慢、面积受控的转换函数。

形式陈述 ​

把预算画成曲线下面积 ​

设 P∈[0,1] 是有效p 值,即在每个零假设分布下

Pr(P≤u)≤u(0≤u≤1).

预先指定非负、非增、可测函数 f:[0,1]→[0,∞]。若

∫01f(u)du≤1,

那么 E=f(P) 是同一零假设的e 值。在所有这种非增函数中,这个积分条件也是必要的,因为 P 可以恰好在 (0,1) 上均匀分布。端点零允许取无穷大;有效 p 值在零假设下不会以正概率等于零。

校准函数的面积预算

非增性让较小的 p 值得到较大的证据。积分条件负责支付全部可能 p 值的平均费用。两者缺一不可:仅让均匀分布下的积分为一,还不能处理更保守的超均匀 p 值。

直觉

为什么超均匀性足够 ​

固定 t≥0。因为 f 非增,集合 {u:f(u)>t} 是从零开始的一段区间,端点可能包含也可能不包含。记它的长度为 at。超均匀性在两种端点约定下都给出

Pr{f(P)>t}≤at.

对严格区间可用 Pr(P<at)≤at,对闭区间则用 Pr(P≤at)≤at。非负随机变量的期望可按尾部面积计算,于是给

Ef(P)=∫0∞Pr{f(P)>t}dt≤∫0∞atdt=∫01f(u)du.

最后一步只是把曲线下面积按竖条或横条计算两次;非负性允许积分交换。因此不需要 p 值连续,也不需要它精确均匀,离散检验产生的保守 p 值同样适用。

例子与边界

两种能完整算出的校准器 ​

固定阈值投注。 在看数据前给定 0<a<1,令

fa(p)=a−11{p≤a}.

曲线高度是 1/a、宽度是 a,积分等于一。它把原先水平 a 的检验压缩成“通过则获得 1/a,否则零”。例如 a=0.05 时,p=0.03 和 p=0.001 都给二十;它保留该阈值上的决定,舍弃阈值以内证据强弱的区分。

幂校准。 预先固定 0<κ<1,令

fκ(p)=κpκ−1(p>0),fκ(0)=∞.

积分为 [pκ]01=1。取 κ=1/2,得到 f(p)=1/(2p)。当 p 为 0.04,0.01,0.0004 时,证据分别为 2.5,5,25。在 α=0.05 的 e 检验下,要求 p≤α2/4=0.000625。这个门槛比普通 p≤0.05 严格,提醒我们:通用转换会丢失一些针对单一显著性水平的信息,并不是免费增强证据。

三个看似自然却无效的替换 ​

直接取 f(p)=1/p 不可行,因为 ∫01du/u=∞。把它乘任意固定正常数仍然不能补救无穷面积。

只要求积分而去掉单调性也不行。取 f(p)=21{p>1/2},积分为一,但常数 p 值 P=1 完全有效,却给 f(P)=2。保守 p 值可能把质量向右搬;非增性正是保证这种移动不会提高平均费用的条件。

在看见 p 后挑最合适的校准器也会破坏证明。考虑两个各自合法的函数:f1(p)=21{p≤1/2} 和 f2(p)=1。逐数据取最大后,在前半区间为二、后半为一,积分成为 3/2。原先每个函数各有一元预算,不意味着二选一可以再共用同一元。

推论与应用

想兼顾多种尺度,可以预先混合 ​

若 f1,…,fK 都是校准器,预先固定权重 wk≥0、∑kwk=1,则

f(p)=∑k=1Kwkfk(p)

仍非增,且积分不超过一。例如把上面的两个函数各取一半,得到前半区间 1.5、后半 0.5,总面积仍是一。权重可以由独立训练资料确定,只要条件于那份资料后,当前 p 值仍超均匀;“训练资料存在”本身不够,必须检查条件有效性。

若函数分 K 段给出,可先用“区间宽度乘高度”核对面积。对大量 p 值,先排序断点,逐项二分查找的成本为 O(log⁡K);单一幂函数只需常数次算术。极小 p 值适合算 log⁡E=log⁡κ+(κ−1)log⁡p。软件显示的数值零可能只是下溢,不能自动当成数学上的 p=0。

从转换到发现程序 ​

校准逐项有效 p 值不要求它们相互独立,因而得到的一组 e 值可以进入e-BH。若只是为同一个零假设汇总多种分析,则用固定权重平均。这两种操作回答不同问题:前者发现哪些假设可拒绝,后者给一个假设形成一份证据。

自测。 固定 f(p)=41{p≤1/4},将它再转成 min(1,1/f(P))。输出只有 1/4 和一,不会恢复原来的 p 值。解释这一信息损失,比背下互取倒数的口号更有用。

参考资料
  • Vladimir Vovk and Ruodu Wang, E-values: Calibration, combination, and applications, 2021,作者稿 §2、Proposition 2.1、式(1):可积非增校准器与幂族。本文用尾面积给出自足证明,例中数值及两个失败转换直接按积分核验。
  • Aaditya Ramdas and Ruodu Wang, Hypothesis testing with e-values, 2025,§2.3、Propositions 2.4–2.5 和 §3.1;用于把固定显著性检验的指示型校准与连续校准放在同一框架中。
关系图谱6 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

使用的工具

被这些条目使用