形式陈述
考虑模型族 { P θ : θ ∈ Θ } 和固定目标 g ( θ ) 。数据依次到达,滤过 公理库 滤过与适应过程 Filtration · Adapted process · Natural filtration 以递增 σ-代数表示信息积累,并刻画过程在每一时刻不使用未来信息。 F t 表示时刻 t 已知的信息。若每个随机集合 C t 由 F t 可测信息构成,并且对每个 θ 都有
P θ ( ∀ t ≥ 1 : g ( θ ) ∈ C t ) ≥ 1 − α , 就称 ( C t ) t ≥ 1 为置信水平至少 1 − α 的置信序列 。这里假定成员事件可测;时间是可数的,因而整个交集事件也可测。
普通置信区间 公理库 置信区间 Confidence interval · Confidence set 以重复抽样覆盖率校准参数区间,并从正态枢轴与二项等尾检验反演算出有限样本端点。 在每个预先固定的 t 保证 P θ ( g ( θ ) ∈ C t ) ≥ 1 − α 。置信序列把“对所有时间”放进同一个概率事件,要求一次成功抽样的整条路径都覆盖真值。这也等价于 inf θ P θ ( ∀ t : g ( θ ) ∈ C t ) ≥ 1 − α ;它没有引入跨不同参数世界的共同随机事件。
直觉
每天打开一次试验仪表盘,与事先只约定第一百天查看,是不同的统计程序。每天都有一次犯错机会,逐日各有 95 % 覆盖,并不能推出整段试验以 95 % 概率从未漏掉真值。
置信序列先控制“至少有一天漏掉”的总概率。于是,在同一个覆盖事件上,无论在哪天读数,读到的集合都包含真值;根据历史决定停止也被这一事件保护,甚至事后选择一个已观测时刻仍不会破坏该事件。受保护的是按既定合法模型和公式产生的整列集合,不是事后换模型、换目标或挑一种最窄方法的自由。
反演路径级检验
对每个候选目标值 m ,构造在复合零假设 g ( θ ) = m 下有效的e-process 公理库 检验鞅与 e-process Test martingale · Test supermartingale · e-process · 检验上鞅 区分固定时刻的 e 值与可在停时读取的证据过程,并用非负检验上鞅构造随时有效检验。 E t ( m ) ,并规定达到 1 / α 就拒绝。定义
C t = { m : E t ( m ) < 1 / α } . 固定真实分布 P θ ,只有对应真实目标的过程需要控制:
{ ∃ t : g ( θ ) ∉ C t } = { ∃ t : E t ( g ( θ ) ) ≥ 1 / α } . Ville 界及其 e-process 版本 公理库 Ville 不等式 Ville's inequality · Ville inequality 非负上鞅在无限时间内达到给定水平的概率,由初始期望除以该水平控制。 使右边的概率不超过 α ,便证明了同时覆盖。这是置信集合—检验对偶 公理库 置信集合与检验的对偶 Confidence set and test duality · Test inversion 逐参数反演 level 检验得到覆盖置信集合,并由置信集合反构造点零假设检验。 的路径版本;无需对连续的所有候选 m 使用并集界,因为在一个固定真实分布下,漏覆盖只涉及一个固定真值。
C t 不必逐步嵌套:一个候选值今天被排除,明天证据回落后可能重新出现。若希望排除永久有效,可以输出 C ~ t = ⋂ s ≤ t C s 。在原来的全时间覆盖事件上,真实参数属于每个交集,所以嵌套化保留同样的覆盖保证。
例子与边界
从有界观测构造一列可计算区间
假设 X t ∈ [ 0 , 1 ] 且 E [ X t ∣ F t − 1 ] = p ,其中 p 固定。高斯混合边界 公理库 混合序贯边界 Mixture boundary · Method of mixtures · Normal mixture boundary 对指数上鞅作预先固定的概率混合,再把财富阈值反解为对所有时间同时有效的偏差边界。 在预先固定的 ρ > 0 下给出
r t = 1 t ( t / 4 + ρ ) log t / 4 + ρ ρ α 2 , C t = [ X ¯ t − r t , X ¯ t + r t ] ∩ [ 0 , 1 ] . 严格按“证据大于等于阈值就拒绝”反演会得到严格不等式定义的集合。这里把两端补入成为闭区间,只会增大集合,覆盖下界因此仍成立;不能把这两个端点约定说成完全相同的反演。
取 α = 0.05 , ρ = 1 。十次中八次成功时,r 10 = 0.50353546 ,区间为 [ 0.29646454 , 1 ] 。一百次中六十五次成功时,r 100 = 0.15507694 ,区间约为 [ 0.49492306 , 0.80507694 ] ,仍包含 p = 0.5 。
图片加载失败 一条样本路径上的置信序列 图中采用数据块 1111111100 、1010101010 ,随后重复八次 1111000000 ,展示 t = 10 , 20 , 40 , 60 , 80 , 100 的区间。它们由同一公式算出,图中真值参考线为 p = 0.5 。这是一条可能的数据路径,并非模拟覆盖率估计;这条路径上的所有图示区间都覆盖 0.5 ,不表示置信序列在每条路径上都会覆盖。
Bernoulli 模型下的 Beta 混合反演
若进一步采用 IID Bernoulli( p ) 模型,先对 0 < p < 1 考虑固定 Beta( 1 , 1 ) 混合。在前 t 次有 s 次成功时,证据为
E t ( p ) = 1 ( t + 1 ) ( t s ) p s ( 1 − p ) t − s . 十次中八次成功给出 E 10 ( p ) = 1 / [ 495 p 8 ( 1 − p ) 2 ] 。在 α = 0.05 下保留 E 10 ( p ) < 20 ,等价于
p 8 ( 1 − p ) 2 > 1 9900 . 左边在 ( 0 , 0.8 ) 上递增、( 0.8 , 1 ) 上递减,分别二分求根可得开区间
C 10 ≈ ( 0.35304219 , 0.98951690 ) . 例如 E 10 ( 0.5 ) ≈ 2.06868687 < 20 ,所以保留 0.5 ;E 10 ( 0.2 ) ≈ 1233.03346 > 20 ,所以排除 0.2 。在这个具体样本上,它比上面的有界均值区间窄;这一比较并未证明所有时间、所有样本路径上都更窄。
参数端点可按退化 Bernoulli 分布单独扩展:p = 0 在全为零时保留,一旦出现一就排除;p = 1 同理。这样明确处理端点,不需要让主公式中的 0 0 承担未说明的约定。
固定目标、停止时间与预测覆盖
如果条件均值随时间漂移,就不存在本构造要求的同一个 p ;将所有数据围绕单一真值中心化的步骤已失效。置信序列本身也不保证宽度实用、停止时间有限或检验功效高。对于偶然落在失败事件上的路径,某些乃至许多区间仍可能漏掉真值。
这里覆盖的是固定参数,分割共形预测 公理库 分割共形预测 Split conformal prediction · 分割保形预测 用独立于拟合过程的校准分数秩构造预测集合,在可交换性下保证新响应的有限样本边际覆盖。 覆盖的是未来随机响应。单次边际预测覆盖既不是参数的全时间覆盖,也不能直接升级为所有未来响应同时被包含。
推论与应用
在UCB 公理库 UCB 算法 UCB1 · upper confidence bound algorithm 在有界随机多臂赌博机中选择经验均值加置信半径最大的手臂。 或最佳臂识别 公理库 最佳臂识别 best-arm identification · pure exploration 以可靠选出最高均值臂为目标,研究纯探索的停止规则与样本复杂度。 中,可按每个臂自己的观测顺序建立合法置信序列,再于随机臂内样本数读取它。若需要所有 K 个臂同时有效,还须在臂维度分配错误预算,例如取 α i = α / K 并使用并集界。时间维度已经受控,不意味着多臂维度也自动受控。
最佳臂识别可在某个臂的下端点高于其余全部上端点时停止:只要所有臂的全时间覆盖事件成立,这个决定就正确。是否最终分离、平均等待多久,则需均值间隙、抽样安排和区间收缩速度的进一步分析。
自测:相同数据,不同量词
对一百次中六十五次成功,固定样本 Hoeffding 区间的半径为
log ( 2 / 0.05 ) 2 ⋅ 100 ≈ 0.13581015 , 比本页置信序列的 0.15507694 小。前者控制预先固定时刻的一次偏差,后者控制无限多个时刻的联合偏差。不能因为两种区间都标有 95 % ,就把前者沿所有 t 重复使用并保留后者的承诺。另一种构造方式是给每个固定时刻分配可求和的 α t ,使 ∑ t α t ≤ α ;这也产生置信序列,说明混合方法是有效构造之一,而非定义本身。
参考资料
Steven R. Howard, Aaditya Ramdas, Jon McAuliffe, Jasjeet Sekhon, Time-uniform, nonparametric, nonasymptotic confidence sequences , The Annals of Statistics 49(2), 1055–1080, 2021,§§1–3 与 Appendix A.3。
Aaditya Ramdas, Peter Grünwald, Vladimir Vovk, Glenn Shafer, Game-Theoretic Statistics and Safe Anytime-Valid Inference , Statistical Science 38(4), 576–601, 2023,§2.8。
Donald A. Darling, Herbert Robbins, Confidence sequences for mean, variance, and median , Proceedings of the National Academy of Sciences 58(1), 66–68, 1967,早期历史来源。