Skip to content

定理Theorem

经验 Bernstein 均值界

Empirical Bernstein mean bound · 经验方差均值界

对已知有界范围的 IID 观测,以经过校准的样本方差构造固定样本均值区间,解释标准差估计误差、零样本方差与重复查看的边界。

Bernstein 能利用小方差,但总体方差往往未知。看完数据后算出的样本方差很小,能不能直接把它塞回公式?困难在于:它自己也会低估。合法的经验 Bernstein 界必须把这份低估风险一起计入。

本页处理一项明确任务:观测独立同分布,真实取值范围已知,样本数预先固定。推导借用一个已标明来源的样本标准差集中引理,再完整计算随机半径;不会把“方差估计无偏”误当成“方差估计总在真值之上”。

形式陈述 ​

数据决定的半径 ​

设 n≥2,X1,…,Xn 是 IID 实值观测,且确定的有限 a<b 满足 Xi∈[a,b] 几乎处处。记 L=b−a,共同均值为 μ,总体 方差为 σ2。令

X¯=1n∑iXi,Sn2=1n−1∑i(Xi−X¯)2.

给定在观察前指定的 0<δ<1,令 ℓ=log⁡(4/δ)。一个方便的经验 Bernstein 半径是

(1)rn=2Sn2ℓn+8Lℓ3(n−1).

它满足

(2)Pr(|X¯−μ|>rn)≤δ.

因此 [X¯−rn,X¯+rn]∩[a,b] 是覆盖概率至少 1−δ 的区间。与固定方差版不同,半径随机;式 (2) 控制的是“数据给出错误区间”这个整体事件。

式 (1) 的常数 8/3 是下文从本站标量 Bernstein 方便式推导的较松版本。Maurer–Pontil 原文 Theorem 4 用更细的 Bennett 步骤得到单侧 7/3 常数;二者不能只换一个数字而忽略证明与失败概率预算的差别。

如果范围退化为 a=b,则读数确定,均值已知,不必使用本页定理。n=1 时样本方差分母为零,本页也不适用。

直觉

方差统计量究竟估计什么 ​

样本方差有等价的成对表示:

(3)Sn2=1n(n−1)∑1≤i<j≤n(Xi−Xj)2.

因为 ∑i<j(Xi−Xj)2=n∑i(Xi−X¯)2。每一对独立同分布观测满足 E(Xi−Xj)2=2σ2,一共有 n(n−1)/2 对,所以 ESn2=σ2。

无偏性只在反复抽样后的平均上成立。某一次全都读到同一个数时,Sn2=0;总体仍可能以很小概率出现别的值。要把它用于置信界,还需控制低估幅度。

这里明确调用 Maurer–Pontil(2009)Theorem 10 的下侧标准差界。将其 [0,1] 结论平移缩放后,对任意 0<η<1,以至少 1−η 的概率有

(4)σ≤Sn+L2log⁡(1/η)n−1.

原定理先控制 ESn2,IID 假设使它等于 σ。这是比“方差无偏”强得多的引理,利用有界观测与成对差结构控制标准差的随机波动;其证明见原文 §2。本文借用式 (4),不声称已在此重证那套集中论证,也不把样本方差直接视为确定上界。

两个事件合起来,支付一次总预算 ​

首先,将 标量 Bernstein 用于 Xi−μ,取中心化幅度 R=L、真实方差预算 V=nσ2。分配失败概率 δ/2,其双侧方便式使用 ℓ=log⁡(4/δ):

(5)|X¯−μ|≤σ2ℓn+2Lℓ3n

以至少 1−δ/2 的概率成立。这里暂时可以在理论事件中保留未知的真方差,下一步才把它替换。

其次,对式 (4) 分配失败概率 η=δ/2。由于 log⁡(2/δ)≤ℓ,以至少 1−δ/2 的概率有

(6)σ≤Sn+L2ℓn−1.

这两个事件通常相关,但 并集界不要求它们独立;其交集概率至少为 1−δ。在交集内,将式 (6) 代入式 (5):

|X¯−μ|≤Sn2ℓn+2Lℓn(n−1)+2Lℓ3n≤2Sn2ℓn+8Lℓ3(n−1).

最后一步用 n(n−1)≥n−1 和 n≥n−1。这就得到式 (1)–(2),也解释线性项为什么不能随意删掉:它既承担均值的幅度项,也承担未知标准差的估计误差。

两个事件共享同一份失败概率预算
例子与边界

1000 次检测后的完整计算 ​

假设检测指标 IID、取值在 [0,1]。事前固定做 n=1000 次,实际看到 10 次故障,目标失败概率 δ=0.01。此时

X¯=0.01,∑i(Xi−X¯)2=10(0.99)2+990(0.01)2=9.9,Sn2=9.9999≈0.00990991,ℓ=log⁡400≈5.99146455.

半径的两项分别为

2Sn2ℓ1000≈0.0108972,8ℓ3⋅999≈0.0159932,

所以 rn≈0.0268905,截到参数范围后,区间约为 [0,0.0368905]。同一固定样本数下,Hoeffding 半径为 log⁡200/2000≈0.0514700。这次样本表现出的小波动带来了更短的区间,但未知方差的校准成本仍然明显。

这个算例不需要事先知道故障率至多百分之一;百分之一是观测比例,不是模型保证。因此它与有先验方差预算的 Bernstein 算例承担不同任务。

零方差观测为什么还要留半径 ​

假设 Xi∼Bernoulli(0.01),固定 n=100。全为零的概率是

(0.99)100≈0.366032.

在这个事件上,X¯=0,Sn2=0,但真实均值仍为 0.01。若以“数据没有波动”为由报告零半径区间 [0,0],失覆盖概率至少为 36.6%,远超过常用的 1% 或 5%。

式 (1) 在 Sn2=0 时仍保留 8Lℓ/[3(n−1)],因而不会作出“总体确定为零”的判断。这里也不声称每一种把样本方差塞进旧公式的做法必然在这一个例子上失败;正确结论是:省去方差校准没有本页证明支持,零半径的具体做法则被上例直接否定。

范围与查看时机仍需事先控制 ​

范围来自总体假设。样本最大值减最小值不是这里的 L。全零数据可能来自几乎总为零、偶尔很大的分布;仅用观测范围会让 L=0,恰好删除需要保留的保护项。只有有限方差、没有已知范围时,转向 MoM 等重尾均值方法,并给出其所需尺度信息。

固定样本保证不自动允许边看边停。式 (2) 控制一个预先固定的 n。若每天都看一次,等区间足够短才停止,选择的随机时刻可能挑中低估最严重的日子。要做这样的任务,应采用 置信序列或明确分配多个时刻的失败概率。

如果只在事前列出的三个样本数 100,500,1000 查看,可以每次用 δ/3,再用并集界得到总失败概率至多 δ。三个区间使用同一批累积数据、彼此依赖并不妨碍并集界;但不能仍给每次完整的 δ 却宣称总预算未变。

小样本不一定改进。线性项可能比平方根项更大,经验 Bernstein 也可能比 Hoeffding 更宽。可在观察前选择一种界;若想看完后取多个区间中较窄的,需为它们的共同覆盖分配预算。两个各自失败率 δ 的区间直接取交集,一般只能由并集界保证失败率至多 2δ。

推论与应用

两道练习 ​

  1. 观测为 0,0,0,1,范围 [0,1],δ=0.05。手算均值、无偏样本方差和本页半径;为什么最后把区间截到 [0,1] 不损失覆盖?
  2. 同一数据改成温度 Yi=20+5Xi。如何从原来的 X¯,Sn2,L,rn 得到新的四个量?如果安排三个固定时刻查看,新的 ℓ 应改成什么?

核对:第一题 X¯=1/4,离均差平方和为 3/4,Sn2=1/4;ℓ=log⁡80,半径约为 4.635238,区间截断后是整个 [0,1],说明这四个样本不足以给出有用的该式区间。真均值已知属于 [0,1],故截断不会删掉真值。第二题均值变成 20+5X¯、方差乘 25、范围宽度乘 5、半径乘 5;三个时刻每次预算 δ/3,统一使用 ℓ=log⁡(12/δ)。

另一种未知方差入口:需要对称性 ​

对称和的自归一化界允许独立观测无已知范围、无已知方差,但要求各自围绕同一中心对称。其固定样本反演用残差平方和,并在 n>2log⁡(2/δ) 时给有限区间;若均值不存在,覆盖目标只是对称中心。它在零样本方差时可能返回单点,本页却保留范围校准项,差异来自总体假设:Bernoulli(0.01) 的全零样本正是不能把对称界套到任意有界总体上的反例。看完数据在两个界中选择更窄的,也需要共同的错误预算。

参考资料
  • Andreas Maurer and Massimiliano Pontil, Empirical Bernstein Bounds and Sample Variance Penalization,arXiv:0907.3740v1,2009-07-21,Theorem 4(原文经验界)、§2 Theorem 10 式 (3)(本页明确借用的标准差下侧集中)。本文的双侧 8/3 版本由上述引理与本站标量 Bernstein 方便式推导,未把它标成原文的最优常数。
关系图谱14 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系