Skip to content

定理Theorem

有界标量 Bernstein 不等式

Scalar Bernstein inequality · Bernstein inequality for bounded random variables

在已知中心化幅度与方差预算时控制独立标量和,以初等指数矩证明解释两种偏差尺度,并计算罕见事件均值的充分样本量。

两个取值都在 [0,1] 的变量,可能一个几乎总为零,另一个经常在两端跳动。只看取值范围,Hoeffding 给二者同样的界;如果已知前者方差很小,Bernstein 还能利用这份信息。

本页是 矩阵 Bernstein 的 d=1 情形,公式并不新。独立入口的作用是让只学过概率的读者完成证明、反解样本量,而不必先经过矩阵谱理论与 Lieb 凹性。把实数 Yi 看作 1×1 Hermitian 矩阵时,谱范数就是 |Yi|,矩阵方差就是 ∑iEYi2。若用较大的 V,右端随方差参数增加而增大,因此仍合法。矩阵页中同时控制全部方向的责任仍留在原页。

形式陈述 ​

两份预算必须同时成立 ​

设整数 n≥1,实变量 Y1,…,Yn 相互 独立,EYi=0。假设存在确定的 R>0,使 |Yi|≤R 几乎处处,并有确定的 方差预算

V≥∑i=1nEYi2.

当 V>0 时,对任意 t>0,

(1)Pr(|∑iYi|≥t)≤min{1,2exp⁡(−t22(V+Rt/3))}.

V 与 R 可以是保守上界,但必须由模型或已证事实支持。若 V=0,各 Yi=0 几乎处处,任何正阈值的尾概率都为零;无需把零方差代进后面的优化参数。若原本 R=0,也直接使用这个退化结论。

R 控制单次可能的冲击,V 控制累计平方波动。两者有不同单位:R 与 Yi 相同,V 带平方单位,分母中 V+Rt/3 才能相加。

对原始观测 Xi∈[a,b],中心化后 Yi=Xi−EXi 可以统一取 R=b−a。通常不能自动取 (b−a)/2:例如 Bernoulli(0.01) 的一次取值 1 离均值为 0.99,超过半个区间宽度。

直觉

证明:为什么幅度与方差一起进入指数矩 ​

先看一个中心化变量 Y,|Y|≤R。对整数 j≥2,

E|Y|j≤Rj−2EY2,j!≥2⋅3j−2.

后一个不等式在 j=2,3 取等,其后每增加一项,阶乘至少再乘 3。利用指数级数和 EY=0,当 |λ|R<3 时有

EeλY≤1+∑j=2∞|λ|jE|Y|jj!≤1+λ2EY22∑j=2∞(|λ|R/3)j−2=1+λ2EY22(1−|λ|R/3).

Y 有界,指数级数可以用确定的可积常数 e|λ|R 控制后逐项取期望。再用 1+u≤eu,得到

(2)log⁡EeλY≤λ2EY22(1−|λ|R/3).

把每项的 矩母函数相乘,独立性将对数指数矩相加。因此对 S=∑iYi 和 0<λ<3/R,

log⁡EeλS≤λ2V2(1−λR/3).

Chernoff 方法便给出

Pr(S≥t)≤exp⁡(−λt+λ2V2(1−λR/3)).

取合法参数 λ=t/(V+Rt/3);因 V>0,它严格小于 3/R。此时 1−λR/3=V/(V+Rt/3),代回指数得到

−t2V+Rt/3+t22(V+Rt/3)=−t22(V+Rt/3).

这只是一个方便而有效的参数选择,不需要声称它精确最小化前面整个有理函数。对 −Yi 重复同一证明,再用 并集界合并两侧,即得式 (1)。

从尾界算出可实施的保证 ​

令 ℓ=log⁡(2/δ),0<δ<1。反解 t2≥2ℓ(V+Rt/3),正根为

(3)t∗=Rℓ3+2Vℓ+(Rℓ3)2.

更好记但稍松的充分阈值为

(4)tδ=2Vℓ+2Rℓ3.

式 (4) 不小于式 (3),因为 a+b≤a+b。这里的线性系数为 2/3;不要与另一些直接由更细 MGF 优化得到的界的 1/3 版本混用。

对于 IID 观测,共同均值 μ,|Xi−μ|≤R,已知 Var(Xi)≤v,取 V=nv,t=nε 得

Pr(|X¯n−μ|≥ε)≤2exp⁡(−nε22(v+Rε/3)).

因此一个充分样本量是

(5)n≥max{1,⌈2(v+Rε/3)log⁡(2/δ)ε2⌉}.

若确定 v=0,直接用一个样本的退化结论,比继续使用式 (5) 更合适。所有这些结论针对预先固定的样本数;反复检查区间并在喜欢的时刻停止,需要额外的全时间校准。

例子与边界

罕见故障:同一个任务节省多少样本 ​

设每次检测独立,故障指标 Xi∼Bernoulli(p)。未知的 p 满足事先给定的模型限制 0≤p≤0.01。目标是把故障率的绝对误差控制在 ε=0.005 内,失败概率不超过 δ=0.01。

范围是 [0,1],所以中心化幅度统一取 R=1。由于 p(1−p) 在 [0,0.01] 上递增,可以取 v=0.01⋅0.99=0.0099。依次计算

ℓ=log⁡200≈5.29831737,v+Rε/3=0.0099+0.005/3=0.011566…,2(v+Rε/3)ℓε2≈4902.70967.

所以取 n=4903 已满足式 (5)。只使用范围的 Hoeffding 界则要求

n≥⌈log⁡2002(0.005)2⌉=105967.

差异来自“故障率至多百分之一”所提供的有效方差预算。这个限制必须独立于此次观测成立;看了少量零故障后自行宣称 p≤0.01,不能获得同样保证。没有这份先验限制时,可用 经验 Bernstein 支付方差估计本身的不确定性。

这一算例的 p 仍然未知,所以估计任务没有消失。上面比较的是充分样本量,不是精确最小样本量,也不是把置信区间长度当成真实误差。

方差区与单次冲击区 ​

当 Rt/3≤V 时,分母 2(V+Rt/3)≤4V,尾界不超过 2e−t2/(4V)。这时偏差主要按平方尺度受控。

当 Rt/3≥V 时,分母不超过 4Rt/3,得到 2e−3t/(4R)。此时幅度预算限制了单次冲击,总体上界呈线性指数尺度。两段是在解释同一个公式的主导项,并不是声称真实分布的尾在 t=3V/R 处突然改变形状。

ψ₁ 变量也有类似的两尺度和界,但它未必有有限的逐项幅度 R。在那里必须用局部指数矩参数替代这里的硬边界,不能把从样本中看见的最大值当成总体幅度上界。

缺少哪一项,会坏在哪里 ​

只有有限方差而没有幅度或合适指数矩,不能得到式 (1)。一个方差固定、偶尔极大的变量,仍可令样本平均以远大于所套指数界的概率失准;MoM通过改变估计量处理这种情况。

即使每项都满足同样的幅度与方差限制,依赖也会破坏和的保证。若所有项都是同一个公平符号 R0,则 S=nR0,Pr(|S|≥n)=1。错误地把它们当独立会设置 V=n,R=1,在 n=8 时给出 2e−3<1。实际和的方差为 n2,独立乘法步骤已经失败。

另一方面,Bernstein 不总比 Hoeffding 更小。若只知道 X∈[0,1],使用最坏方差 v=1/4,式 (5) 多出的线性项会使它比 Hoeffding 的充分样本量更保守。拥有更多形式不意味着每次都应该选同一个公式;应比较在当前假设下合法的界。

推论与应用

复算与迁移 ​

  1. 对 n=1000 个独立中心化项,已知各项方差至多 0.02、幅度至多 1。取 δ=0.05,分别用式 (3)、(4) 计算总和阈值,为什么较松式仍然有效?
  2. 改用两条生产线的检测数据:A线有 600 个 Bernoulli(pA) 观测,已知 pA≤0.01;B线有 400 个 Bernoulli(pB) 观测,已知 pB≤0.04。两组内及组间的全部观测相互独立,但不要求 pA=pB。把这 1000 个指标直接平均,估计的目标是什么?写出中心化总和、方差预算,并在 δ=0.05 下给平均误差的半径。能否沿用上一例 p≤0.01 的共同方差预算?

核对第一题:V=20,ℓ=log⁡40,精确反解阈值约为 13.438933,方便式约为 14.606482;后者对平方根作了合法放松。

第二题的平均值估计

θ=EX¯=0.6pA+0.4pB,

不是自动估计两条生产线故障率的等权平均 (pA+pB)/2。写 XA,i,XB,j 为两组指标,则中心化总和为

S=∑i=1600(XA,i−pA)+∑j=1400(XB,j−pB)=1000(X¯−θ).

每项中心化幅度可取 R=1。两个参数上界都小于 1/2,方差 p(1−p) 在这些区间内递增;独立性使方差相加,得到

Var(S)≤600(0.01)(0.99)+400(0.04)(0.96)=5.94+15.36=21.30=:V.

现在直接用独立总和的式 (3),不调用 IID 均值简式。取 ℓ=log⁡40,

t∗=ℓ3+2(21.30)ℓ+(ℓ/3)2≈13.825588.

所以平均误差半径 r=t∗/1000≈0.013825588,满足 Pr(|X¯−θ|>r)≤0.05;用方便式 (4) 则给稍大的半径 0.014995052。保证无需两条生产线有相同故障率。

不能沿用旧的共同预算 1000⋅0.0099=9.9:例如允许的 pA=0.01,pB=0.04 已使总方差等于 21.30。同时,也不能只把估计目标的名字改成共同的 p;分组采样比例决定了这里的目标权重。若想估计两条线的等权平均,可以改用 (X¯A+X¯B)/2,再按不同权重重新计算幅度与方差预算。

放进自然滤过,得到可预测方差的特例 ​

本页独立中心化变量令 Di=Yi,并采用自然滤过 Fi=σ(Y1,…,Yi),则 E[Di∣Fi−1]=0,且条件方差为确定的 Var(Yi)。因而标量 Freedman 不等式在固定时刻、确定方差预算下包含本页尾界;原有 |Yi|≤R 还允许对 S 与 −S 分别使用 Freedman,再取并集界,恢复本页双侧式前的因子2。原有标量证明仍提供不必先学鞅的直接入口。若滤过预先揭示其他有关未来尺度的信息,独立增量之间的关系本身并不足以保证条件方差还是确定数,需要重新检查对整个过去的信息独立性。

参考资料
关系图谱13 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系