形式陈述
固定一个统计检验 理路 统计假设检验 Statistical hypothesis test · Test function 在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。 问题,零假设 H 0 是一族数据生成分布,所有过程使用共同的滤过 ( F t ) 。以下对象承担不同层次的保证。
e 值(e-value) 是非负随机变量 E ,满足
sup P ∈ H 0 E P E ≤ 1. 它是一份在指定抽样规则下校准的静态证据。检验鞅 是初值 M 0 = 1 、在每个 P ∈ H 0 下均为非负鞅 理路 鞅 Martingale · Submartingale · Supermartingale 在当前全部信息下,下一步条件均值等于当前值的可积适应过程。 的过程;把条件期望等式换成 E P [ M t ∣ F t − 1 ] ≤ M t − 1 ,得到检验上鞅。
本页采用有限停时版本的 e-process 定义:非负适应过程 ( E t ) t ≥ 0 对每个 P ∈ H 0 和每个在 P 下几乎必然有限的停时 理路 停时 Stopping time · 停止时刻 是否已经发生可由当前信息判断、因而不依赖未来的随机时刻。 τ ,都满足
E P E τ ≤ 1. 确定时刻也是停时,因而 e-process 的每个 E t 都是 e 值,反向推论不成立。检验上鞅是 e-process 的一个充分构造:对 τ ∧ N 使用有界可选停止 理路 可选停止定理 Optional stopping theorem · Optional sampling theorem 在足以控制随机停止与极限交换的条件下,鞅的期望在停时前后保持不变。 ,再利用非负性和 Fatou 引理 理路 Fatou 引理 Fatou's lemma 非负可测函数列下极限的积分不超过积分的下极限。 ,即有 E P M τ ≤ 1 。一般 e-process 不必自身满足上鞅的逐步条件期望不等式。
直觉
e 值像一次下注后的财富,零模型下平均不超过一元。e-process 的承诺更强:读者可以根据已经看到的历史决定何时结算,平均预算仍不超过一元。检验上鞅通过每一步都遵守预算实现这一承诺,e-process 则直接要求所有合法结算规则都有效。
较大的财富表示零模型很难经常支付这样的回报。它不是零假设的后验概率,也不是把普通 p 值重新命名。一个 e 值等于 20 ,通过Markov 不等式 理路 Markov 不等式 Markov's inequality 非负随机变量超过阈值的概率由其期望除以阈值控制。 给出相应拒绝规则的错误上限 1 / 20 ;它不表示零假设有 5 % 的概率为真。
从条件公平到可预测投注
检验 H 0 : p = p 0 ,其中 0 < p 0 < 1 ,并假设给定 F t − 1 后 X t 服从 Bernoulli( p 0 ) 。在看见 X t 之前选择 F t − 1 可测的 q t ∈ [ 0 , 1 ] ,定义
B t = { q t / p 0 , X t = 1 , ( 1 − q t ) / ( 1 − p 0 ) , X t = 0 , M t = ∏ i = 1 t B i , M 0 = 1. 这是按历史选择备择成功率后得到的条件似然比 理路 似然函数 Likelihood function 固定可观测数据后,由共同支配密度定义、仅在参数间作相对比较的似然函数。 。由于
E [ B t ∣ F t − 1 ] = p 0 q t p 0 + ( 1 − p 0 ) 1 − q t 1 − p 0 = 1 , 乘上已知的 M t − 1 就证明了鞅性质。q t 可以随过去变化,但不能取看见当前结果才确定的 q t = X t ;后者让单步因子的条件期望变成 2 。分段写法也明确允许 q t = 0 或 1 ,无需给 0 0 另作约定。
例子与边界
一条会回落的证据路径
取 p 0 = 1 / 2 、始终 q t = 3 / 4 。成功乘 1.5 ,失败乘 0.5 。对数据 1 , 1 , 1 , 1 , 0 ,财富为
t
0
1
2
3
4
5
M t
1
1.5
2.25
3.375
5.0625
2.53125
设 α = 0.2 ,阈值为 5 。第四次观测触发拒绝;第五次的回落不撤销“曾经越界”的事实。预先定义的拒绝事件是整条路径是否越界,而不是最后一次显示的财富是否仍然足够高。
两个不能混淆的反例
令 Y t 独立地以各一半概率取 0 或 2 。每个固定时刻 Y t 都是 e 值;然而首次出现 2 的停时几乎必然有限,在该时刻读到的值恒为 2 。所以这串 e 值不是 e-process,其最终越过 2 的概率为一。
反过来,确定性过程 E 0 = 1 , E 1 = 0 , E t = 1 (t ≥ 2 )在每个停时的取值都不超过一,因而是 e-process,但从第一步到第二步条件均值从零升到一,不是上鞅。它说明检验上鞅是易于验证的结构条件,而非 e-process 的另一种名称。
复合均值零假设
设零假设包含所有满足 X t ∈ [ 0 , 1 ] 和 E [ X t ∣ F t − 1 ] ≤ p 0 的过程,其中 0 < p 0 < 1 。对可预测的 λ t ∈ [ 0 , 1 / p 0 ] ,取
B t = 1 + λ t ( X t − p 0 ) . 下界 B t ≥ 1 − λ t p 0 ≥ 0 ,且条件均值不超过一,所以乘积给出在整个复合零假设下共同有效的检验上鞅。若允许负 λ t ,条件均值的不等号会反向,原来的单侧零假设就不够用了。
把一串 e 值连乘时,真正需要检查的是每个新因子给定历史的条件均值预算。若在每个零假设分布下,新因子都独立于当前历史,其条件均值就等于不超过一的边际均值;相互独立的 e 值配合由已观察因子生成的自然滤过,是满足这一要求的例子。若历史还包含其他信息,则仍须相对于这份完整历史检查条件预算,不能只凭因子之间相互独立便下结论。各自边际均值不超过一而可能依赖时,也不能直接连乘;用同一数据重复计算几个 e 值尤其如此。
推论与应用
Ville 不等式 理路 Ville 不等式 Ville's inequality · Ville inequality 非负上鞅在无限时间内达到给定水平的概率,由初始期望除以该水平控制。 给检验上鞅以无限时间越界界。对一般 e-process,同样令 τ 为首次达到 1 / α 的时刻;在有界停时 τ ∧ N 上,
1 ≥ E P E τ ∧ N ≥ α − 1 P ( τ ≤ N ) . 令 N → ∞ 即得对每个 P ∈ H 0 都有 P ( ∃ t : E t ≥ 1 / α ) ≤ α 。因此
p t = min { 1 , 1 max 0 ≤ s ≤ t E s } 是随时有效的 p 值 理路 p 值 p-value 在零假设下校准的证据统计量,其小值事件的概率不超过对应阈值。 过程(最大值为零时把倒数视为无穷大)。它记录历史最强证据;运行最大值本身通常不是 e-process,因为它保留收益而抹去亏损,未必还有均值一的预算。
混合序贯边界 理路 混合序贯边界 Mixture boundary · Method of mixtures · Normal mixture boundary 对指数上鞅作预先固定的概率混合,再把财富阈值反解为对所有时间同时有效的偏差边界。 把许多合法策略按固定概率权重平均,得到无需预先押中单一备择的新过程。对每个候选参数分别构造这样的证据,再保留尚未被拒绝的候选值,就得到置信序列 理路 置信序列 Confidence sequence · Anytime-valid confidence sequence · 时间一致置信序列 一列随数据更新的随机置信集合,以规定概率在所有时间同时覆盖同一个固定参数目标。 。这一步把证据过程转成整条时间轴上的参数不确定性。
参考资料
Aaditya Ramdas, Peter Grünwald, Vladimir Vovk, Glenn Shafer, Game-Theoretic Statistics and Safe Anytime-Valid Inference , Statistical Science 38(4), 576–601, 2023,§§2.1–2.5、2.7;作者稿 。
Glenn Shafer, Testing by betting: A strategy for statistical and scientific communication , Journal of the Royal Statistical Society: Series A 184(2), 407–431, 2021。