Skip to content

定义Definition

置信序列

Confidence sequence · Anytime-valid confidence sequence · 时间一致置信序列

一列随数据更新的随机置信集合,以规定概率在所有时间同时覆盖同一个固定参数目标。

形式陈述 ​

考虑模型族 {Pθ:θ∈Θ} 和固定目标 g(θ)。数据依次到达,滤过 Ft 表示时刻 t 已知的信息。若每个随机集合 Ct 由 Ft 可测信息构成,并且对每个 θ 都有

Pθ(∀t≥1:g(θ)∈Ct)≥1−α,

就称 (Ct)t≥1 为置信水平至少 1−α 的置信序列。这里假定成员事件可测;时间是可数的,因而整个交集事件也可测。

普通置信区间在每个预先固定的 t 保证 Pθ(g(θ)∈Ct)≥1−α。置信序列把“对所有时间”放进同一个概率事件,要求一次成功抽样的整条路径都覆盖真值。这也等价于 infθPθ(∀t:g(θ)∈Ct)≥1−α;它没有引入跨不同参数世界的共同随机事件。

直觉

每天打开一次试验仪表盘,与事先只约定第一百天查看,是不同的统计程序。每天都有一次犯错机会,逐日各有 95% 覆盖,并不能推出整段试验以 95% 概率从未漏掉真值。

置信序列先控制“至少有一天漏掉”的总概率。于是,在同一个覆盖事件上,无论在哪天读数,读到的集合都包含真值;根据历史决定停止也被这一事件保护,甚至事后选择一个已观测时刻仍不会破坏该事件。受保护的是按既定合法模型和公式产生的整列集合,不是事后换模型、换目标或挑一种最窄方法的自由。

反演路径级检验 ​

对每个候选目标值 m,构造在复合零假设 g(θ)=m 下有效的e-process Et(m),并规定达到 1/α 就拒绝。定义

Ct={m:Et(m)<1/α}.

固定真实分布 Pθ,只有对应真实目标的过程需要控制:

{∃t:g(θ)∉Ct}={∃t:Et(g(θ))≥1/α}.

Ville 界及其 e-process 版本使右边的概率不超过 α,便证明了同时覆盖。这是置信集合—检验对偶的路径版本;无需对连续的所有候选 m 使用并集界,因为在一个固定真实分布下,漏覆盖只涉及一个固定真值。

Ct 不必逐步嵌套:一个候选值今天被排除,明天证据回落后可能重新出现。若希望排除永久有效,可以输出 C~t=⋂s≤tCs。在原来的全时间覆盖事件上,真实参数属于每个交集,所以嵌套化保留同样的覆盖保证。

例子与边界

从有界观测构造一列可计算区间 ​

假设 Xt∈[0,1] 且 E[Xt∣Ft−1]=p,其中 p 固定。高斯混合边界在预先固定的 ρ>0 下给出

rt=1t(t/4+ρ)log⁡t/4+ρρα2,Ct=[X¯t−rt,X¯t+rt]∩[0,1].

严格按“证据大于等于阈值就拒绝”反演会得到严格不等式定义的集合。这里把两端补入成为闭区间,只会增大集合,覆盖下界因此仍成立;不能把这两个端点约定说成完全相同的反演。

取 α=0.05,ρ=1。十次中八次成功时,r10=0.50353546,区间为 [0.29646454,1]。一百次中六十五次成功时,r100=0.15507694,区间约为 [0.49492306,0.80507694],仍包含 p=0.5。

一条样本路径上的置信序列

图中采用数据块 1111111100、1010101010,随后重复八次 1111000000,展示 t=10,20,40,60,80,100 的区间。它们由同一公式算出,图中真值参考线为 p=0.5。这是一条可能的数据路径,并非模拟覆盖率估计;这条路径上的所有图示区间都覆盖 0.5,不表示置信序列在每条路径上都会覆盖。

Bernoulli 模型下的 Beta 混合反演 ​

若进一步采用 IID Bernoulli(p) 模型,先对 0<p<1 考虑固定 Beta(1,1) 混合。在前 t 次有 s 次成功时,证据为

Et(p)=1(t+1)(ts)ps(1−p)t−s.

十次中八次成功给出 E10(p)=1/[495p8(1−p)2]。在 α=0.05 下保留 E10(p)<20,等价于

p8(1−p)2>19900.

左边在 (0,0.8) 上递增、(0.8,1) 上递减,分别二分求根可得开区间

C10≈(0.35304219,0.98951690).

例如 E10(0.5)≈2.06868687<20,所以保留 0.5;E10(0.2)≈1233.03346>20,所以排除 0.2。在这个具体样本上,它比上面的有界均值区间窄;这一比较并未证明所有时间、所有样本路径上都更窄。

参数端点可按退化 Bernoulli 分布单独扩展:p=0 在全为零时保留,一旦出现一就排除;p=1 同理。这样明确处理端点,不需要让主公式中的 00 承担未说明的约定。

固定目标、停止时间与预测覆盖 ​

如果条件均值随时间漂移,就不存在本构造要求的同一个 p;将所有数据围绕单一真值中心化的步骤已失效。置信序列本身也不保证宽度实用、停止时间有限或检验功效高。对于偶然落在失败事件上的路径,某些乃至许多区间仍可能漏掉真值。

这里覆盖的是固定参数,分割共形预测覆盖的是未来随机响应。单次边际预测覆盖既不是参数的全时间覆盖,也不能直接升级为所有未来响应同时被包含。

推论与应用

在UCB或最佳臂识别中,可按每个臂自己的观测顺序建立合法置信序列,再于随机臂内样本数读取它。若需要所有 K 个臂同时有效,还须在臂维度分配错误预算,例如取 αi=α/K 并使用并集界。时间维度已经受控,不意味着多臂维度也自动受控。

最佳臂识别可在某个臂的下端点高于其余全部上端点时停止:只要所有臂的全时间覆盖事件成立,这个决定就正确。是否最终分离、平均等待多久,则需均值间隙、抽样安排和区间收缩速度的进一步分析。

自测:相同数据,不同量词 ​

对一百次中六十五次成功,固定样本 Hoeffding 区间的半径为

log⁡(2/0.05)2⋅100≈0.13581015,

比本页置信序列的 0.15507694 小。前者控制预先固定时刻的一次偏差,后者控制无限多个时刻的联合偏差。不能因为两种区间都标有 95%,就把前者沿所有 t 重复使用并保留后者的承诺。另一种构造方式是给每个固定时刻分配可求和的 αt,使 ∑tαt≤α;这也产生置信序列,说明混合方法是有效构造之一,而非定义本身。

参考资料
关系图谱10 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系