一次实验把证据记为一个非负数。若零假设成立,它的平均值不能超过一;但在与零假设不协调的数据上,它可以很大。这样的数称为 e 值。它把“罕见的大证据”约束成一个期望预算,因此特别适合平均、拆分和多重发现。
先看一个硬币实验。预先约定抛四次,检验公平硬币,把“更偏向正面”的成功率 作为比较模型。每次正面记乘数 ,每次反面记乘数 。四个正面给出的乘积为 ,三个正面一个反面给 。我们没有把乘积解释成概率;它比较两种模型对同一数据支付的权重。
形式陈述
定义中的三个条件
设零假设理路统计假设检验Statistical hypothesis test · Test function在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。 是一族可能的数据分布。统计量 是这一零假设的 e 随机变量,如果
严格区分时,随机函数叫 e-variable,它在观察数据后取得的数叫 e-value;本页和常见文献一样,也用“e 值”指前者。允许在零假设概率为零的观测上取 。在任何零分布下,有限均值保证它几乎必然有限。
非负性防止靠巨大的负值补贴任意多的错误拒绝。期望是针对预先确定的数据取得和计算规则取的。上确界要求每个零模型都守住预算;只在其中一个参数值下算到一,并不能认证整个复合零假设。
给定 ,在 时拒绝。Markov 不等式理路Markov 不等式Markov's inequality非负随机变量超过阈值的概率由其期望除以阈值控制。立即给出
例如 足以通过水平 的阈值 ,也给出保守 p 值 。这不表示零假设有 概率为真。转换 时约定 、;由上式可逐个阈值验证它是有效 p 值。
直觉
似然比为什么符合预算
简单零假设有密度 ,事先选定比较密度 ,二者相对于同一参考测度。取似然比理路似然函数Likelihood function固定可观测数据后,由共同支配密度定义、仅在参数间作相对比较的似然函数。
在 处设为无穷大,在 处设为零。这些取值不影响零模型下的积分:
若比较分布没有跑到零分布支撑之外,等号成立。这个证明只用密度积分,不需要大样本极限、正态近似或可微参数模型。对 个独立观测,联合密度之比就是逐点比值的乘积。
硬币例中,设 为正面次数,在公平零模型下
当 时阈值为五,只有四个正面越界,错误率为 。预算可以保守;Markov 阈值不承诺用尽全部允许错误概率。
例子与边界
复合均值零假设的直接构造
设只知道 ,检验 。这个零假设允许离散、连续和混合分布。定义
范围保证 ,均值条件保证 。取 时就是 。这里只有一个有界观测,所以证据最多为二,不可能达到 检验的二十倍阈值。有效性和有足够功效是两件需要分别检查的事。
若错误允许 ,零假设内的常数 会给 ;若允许 , 时证据为负。两个方向的限制分别承担均值预算与非负性,不能省略。
选择和停止为什么需要另一个接口
两个合法证据取最大值通常失效。令公平二元结果 取零或一,构造 、。它们的均值都是一,最大值却恒为二。先看结果再选“最支持结论的那个分析”,把均值预算翻了一倍。固定平均 则仍有效。
把同一个证据重复相乘也不能假装收到了新数据。若 ,则 ,虽然每个副本单独都是 e 值。e 值合并理路e 值的平均、乘积与选择Merging e-values · e-merging function · Combining e-values按同一零假设核对每份证据,证明任意依赖下的固定平均与条件有效乘积,给出最大值、重复证据和数据依赖权重的反例。会逐一说明什么时候可以平均或相乘。
静态定义也不准许任意停止后读取。让 每次独立等概率取零或二,每个固定时刻都有均值一,但等到第一次出现二再报告,得到的证据恒为二。e-process理路检验鞅与 e-processTest martingale · Test supermartingale · e-process · 检验上鞅区分固定时刻的 e 值与可在停时读取的证据过程,并用非负检验上鞅构造随时有效检验。对合法停时直接要求均值预算,承担的是更强的保证;这个序贯概念需要滤过和停时,本页的固定样本结论不以那些概念为前置。
推论与应用
怎样交付一份可检查的证据
计算前写下零模型、样本规则和证据函数;计算后报告观察到的值、使用的阈值以及上述均值证明。联合密度比常用对数计算:将各项 相加,再与 比较,避免连乘下溢。计算 项需要 次密度评价和 累积空间,密度评价本身的费用另计。
要把有限样本 e 值用于多假设发现,可读e-BH理路e-BH 与任意依赖的 FDR 控制e-BH procedure · e-Benjamini–Hochberg procedure · eBH按降序 e 值寻找最大自洽发现集合,用逐样本预算消去随机拒绝数,在任意依赖下控制 FDR,并核对过滤与停止的边界。;要让比较密度由数据学习,可读分割似然比理路分割似然比与有限样本推断Split likelihood-ratio test · Universal inference · split LRT只用训练样本拟合比较密度,在独立检验样本上除以零假设的似然上确界,构造不依赖渐近卡方的检验并核对优化误差方向。。这两条后继分别改变决策规则和证据构造,均保留“每个真零模型下均值不超过一”这个接口。
自测。 令 以概率 取三十,其余取零。它的均值是一。在水平 时错误率为 ;若把每个输出都乘二,均值成为二,新统计量就不再是原定义下的 e 值。观察到六十本身无法修复校准。
参考资料
- Vladimir Vovk and Ruodu Wang, E-values: Calibration, combination, and applications, Annals of Statistics 49(3), 1736–1754, 2021;所链接作者稿 §2、Proposition 2.2,静态定义和 e 到 p 校准。
- Aaditya Ramdas, Peter Grünwald, Vladimir Vovk, Glenn Shafer, Game-Theoretic Statistics and Safe Anytime-Valid Inference, Statistical Science 38(4), 576–601, 2023,§§2.1–2.5,似然比、e 值和序贯证据的区别。本文有限硬币与有界均值例由定义直接计算。