Skip to content

定义Definition

次高斯随机变量

Sub-Gaussian random variable · 次高斯尺度 · Subgaussian variance proxy

用全实数上的中心化指数矩上界定义次高斯尺度,计算独立加权平均的尾界,并区分方差、尺度代理与条件次高斯假设。

有界读数不会突然出现无限大的冲击,因此平均容易稳定。但正态噪声并没有硬边界,也能给出平方偏差的指数尾界。次高斯条件保留的正是这份尾部控制:不要求变量真的是正态,只要求它的中心化指数矩不会超过某个正态变量。

本页使用可直接带进样本量计算的尺度约定。只需先理解 矩母函数;有界变量的指数矩推导继续复用 Hoeffding 引理。

形式陈述 ​

“尺度为多少”比“属于哪一类”更重要 ​

设实随机变量 X 可积,记 μ=EX。给定确定常数 s≥0,若对每个 λ∈R 都有

(1)Eeλ(X−μ)≤eλ2s2/2,

就称 X 具有次高斯尺度上界 s,或称其中心化变量为 s-次高斯。s2 常叫方差代理。存在某个有限 s 才是“次高斯”这个类别;实际使用式 (1),必须交出所用 s 的依据。

中心化不可省略。若直接写 EeλX≤eλ2s2/2 对所有正负 λ 成立,在零点附近比较一阶项就会迫使 EX=0。平移一个变量不会改变本页的中心化尺度,而未经中心化的矩母函数会多出 eλμ。

任意更大的 s 也满足式 (1),所以它不一定是最小可能尺度。指数矩在零点邻域有限,允许比较二阶项:左侧为 1+λ2Var(X)/2+o(λ2),右侧为 1+λ2s2/2+o(λ2),故 方差满足

Var(X)≤s2.

反方向一般不成立。s=0 时方差为零,X=μ 几乎处处;下文所有含 1/s 的式子仅用于 s>0。

从尺度到尾界,再到平均 ​

令 Y=X−μ,对 t>0,λ>0 使用 指数 Markov 方法:

Pr(Y≥t)≤exp⁡(−λt+λ2s2/2).

右侧指数在 λ=t/s2 时最小。对 −Y 同样处理,得到

(2)Pr(|X−μ|≥t)≤2e−t2/(2s2).

这个上界可能大于 1,必要时与 1 取小值即可。它是上界,不是在声称正态尾恰好等于该指数。

现在设 X1,…,Xn 相互独立,第 i 项的中心化尺度上界为 si。对预先固定的实权重 ai,独立性使

(3)Eexp⁡(λ∑iai(Xi−EXi))=∏iEeλai(Xi−EXi)≤exp⁡(λ22∑iai2si2).

因此独立加权和的平方尺度可取 ∑iai2si2,包括负权重。这里不要求同分布;如果权重根据同一批观测自适应选择,乘积分解后的逐项界不能直接照搬。

特别地,IID 样本具有共同均值 μ 和尺度上界 s 时,样本平均的尺度为 s/n。给定 ε>0,0<δ<1,

(4)Pr(|X¯n−μ|≥ε)≤2exp⁡(−nε22s2),n≥⌈2s2log⁡(2/δ)ε2⌉

是一个充分样本量条件。若右侧整数为零,只发生在退化的 s=0 情形,此时至少取一个观测即可;非退化时取整自然给正整数。

直觉

三个能亲自验证的尺度 ​

正态噪声。若 X∼N(μ,σ2),直接计算矩母函数得到式 (1) 的等号,所以 s2=σ2 可用,也是最小值。它说明“次高斯”容许无界观测。

公平随机符号。若 R 以相同概率取 −1,+1,则 EeλR=cosh⁡λ。对 λ≥0,tanh⁡λ≤λ,积分得 log⁡cosh⁡λ≤λ2/2;两边都是偶函数,因此对所有实 λ 成立。R 可取 s=1,尽管它的分布只有两个点,绝不是正态。

已知范围。若 X∈[a,b] 几乎处处,Hoeffding 引理给出 log⁡Eeλ(X−μ)≤λ2(b−a)2/8,所以可取 s=(b−a)/2。将它代入式 (4),正好恢复已有的 Hoeffding 均值界;这不是另一个更强定理。

以两台独立、无偏的仪器为例,第一台噪声为 N(0,1),第二台噪声等概率取 ±2。合成误差 T=(3/4)Y1+(1/4)Y2 的平方尺度可取

sT2=(3/4)2⋅1+(1/4)2⋅4=1316.

因此 Pr(|T|≥2)≤2exp⁡[−4/(2⋅13/16)]≈0.170607。如果改成把第二台的权重符号按第一台读数决定,就需要重新分析依赖,不能仅凭系数平方相同保留这个计算。

例子与边界

方差很小,尾部仍可能比这个尺度更大 ​

取 X∼Bernoulli(0.01)。它的方差为 0.0099,却不能把这个数直接当作式 (1) 的 s2。取 λ=5,

Ee5(X−0.01)=e−0.05(0.99+0.01e5)≈2.353467,

而 exp⁡(25⋅0.0099/2)≈1.131733。所需不等式已经反向。

这并不否定 X 次高斯:因为 X∈[0,1],s2=1/4 始终合法。稀有的取值 1 对方差贡献不大,却会被大的正指数参数强烈放大。若同时知道范围与小方差,标量 Bernstein 能把两份信息一起使用;不能用一个过小的次高斯代理冒充这一改进。

更重的 Pareto 尾还可以具有有限方差,但没有任何正指数矩。例如密度 3x−41x≥1 有均值 3/2、方差 3/4,而 EeλX=∞ 对每个 λ>0 成立。有限二阶矩并不蕴含次高斯;此时可改用 分组均值中位数 的有限方差方案。

ψ₂ 约定、ψ₁ 边界与条件信息 ​

有些教材用

‖Y‖ψ2=inf{K>0:Eexp⁡(Y2/K2)≤2}

描述次高斯。对中心化变量,这与式 (1) 定义同一类,但最优常数一般不同,不能把两个记号中的数值直接相等。本页始终用式 (1) 的 s 算样本量。

从本页的尾界还能看出一个具体换算。若 s>0,用 Tonelli 定理交换非负积分,尾积分公式给出

EeY2/(6s2)=1+∫1∞Pr(|Y|>s6log⁡u)du≤1+∫1∞2u−3du=2.

所以 ‖Y‖ψ2≤6s。反向等价可见参考资料的 Proposition 2.5.2;本页后续推导不借用未指定的等价常数。

次高斯还属于 ψ₁ 次指数尾类。例如上式给 K=6s;由 |y|/(2K)≤y2/(2K2)+1/8 和 Cauchy–Schwarz,Ee|Y|/(2K)≤e1/82<2,所以中心化 Y 的 ψ₁ 尺度有限。原始 X=Y+μ 平移后仍有有限 ψ₁ 尺度。反过来不成立:指数分布的正指数矩只在有限参数区间内存在。

最后,边缘次高斯不等于相对于过去的条件次高斯。令 R 是一个公平符号,令所有 Xi=R。每项都满足 s=1 的边缘界,但平均永远是 R,Pr(|X¯n|≥1/2)=1。例如 n=16 时错误套用独立均值公式会给 2e−2<1,直接矛盾。

第二项以后,一旦过去揭示 R,就有 E[Xi∣过去]=R,不是零。自适应过程要检查每一步给定过去后的指数矩。混合序贯边界已经完整给出这一条件接口及其上鞅证明;仅换一个名字不会消除对信息结构的要求。

推论与应用

两道自测 ​

  1. 已知独立读数的中心化尺度 s=2,要求误差 ε=0.2、失败概率 δ=0.01。需要多少个样本?如果只知道标准差不超过 2,能否采用同一个数?
  2. 已知 X∈[2,6],求一个合法次高斯尺度;再把读数改成 W=3X−10,给出 W 的尺度以及其均值估计所需误差应怎样同步换单位。

核对:第一题 n≥⌈200log⁡200⌉=1060;只知道标准差上界不能采用该推导,需另有次高斯代理依据或改用有限方差方法。第二题可取 sX=2,sW=6;若要保持同一物理精度,W 的绝对误差阈值应为 X 的三倍,此时式 (4) 中 s2/ε2 不变。

参考资料
  • Roman Vershynin, High-Dimensional Probability, 第一版作者订正版,§2.5(Proposition 2.5.2、Definition 2.5.6)与 §2.6,2026-10-08 读取。电子稿封面标注 2024-05-20、修订前言标注 2025-05-12;本页的可计算尺度采用中心化 MGF 约定,ψ₂ 常数仅按已展示的换算使用。
关系图谱14 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系