正态测量误差的平方不再是次高斯,却仍有可用的指数尾。平方损失、随机乘积和等待时间常把我们带到这个中间层:尾比高斯重,但还没有重到丢掉所有正指数矩。
这里的“次指数尾”指集中不等式中的 ψ₁ 类。本站另有 次指数分布 理路 次指数分布 Subexponential distribution · Principle of a single big jump 次指数重尾的固定有限和超过高门槛时,主要由一个分量单独超过门槛造成,其和尾渐近为单项尾的项数倍。 ,研究重尾和中的“一次大跳”;那是卷积尾类 S 。两者共享英文词,不共享定义。本页保留 ψ₁ 标签,避免把这个差别藏进标题。
形式陈述
一份可计算的指数尺度
对实随机变量 X ,定义
(1) ‖ X ‖ ψ 1 = inf { K > 0 : E e | X | / K ≤ 2 } , 空集的下确界记为 ∞ 。若这个量有限,称 X 具有 ψ₁ 次指数尾。实际推导时采用某个已验证满足 E e | X | / K ≤ 2 的 K > 0 ,不必先找到最小值。
这个定义不要求零均值。它把中心位置也算入尺度,所以与中心化 次高斯尺度 理路 次高斯随机变量 Sub-Gaussian random variable · 次高斯尺度 · Subgaussian variance proxy 用全实数上的中心化指数矩上界定义次高斯尺度,计算独立加权平均的尾界,并区分方差、尺度代理与条件次高斯假设。 的平移约定不同。处理偏离均值的概率之前,应先写清自己控制的是 X 还是 X − E X 。
由 Markov 不等式 理路 Markov 不等式 Markov's inequality 非负随机变量超过阈值的概率由其期望除以阈值控制。 ,对每个 t ≥ 0 ,
(2) Pr ( | X | ≥ t ) ≤ 2 e − t / K . 同样,利用 Tonelli 理路 Tonelli 定理 Tonelli's theorem 非负可测函数的二重积分与两种迭代积分相等,允许共同取无穷。 将非负尾积分交换次序,对每个整数 p ≥ 1 得
(3) E | X | p = p ∫ 0 ∞ t p − 1 Pr ( | X | > t ) d t ≤ 2 K p p ! . 尤其均值与所有整数阶矩都存在。反过来,若已经知道式 (2) 对某个 K 成立,尾积分给
E e | X | / ( 3 K ) = 1 + ∫ 1 ∞ Pr ( | X | > 3 K log u ) d u ≤ 1 + 2 ∫ 1 ∞ u − 3 d u = 2. 因此指数型尾上界也给 ψ₁ 尺度,但换算中付出了常数 3 。不能在不同定义之间迁移时默认尺度完全相同。
中心化要支付多少尺度
若 E e | X | / K ≤ 2 ,Jensen 不等式 理路 Jensen 不等式 Jensen's inequality 凸函数作用于平均值不超过函数值的相同加权平均。 给出 E | X | ≤ K log 2 ,故 | E X | ≤ K log 2 。再由 Cauchy–Schwarz 理路 Cauchy–Schwarz 不等式 Cauchy–Schwarz inequality · 柯西–施瓦茨不等式 内积的绝对值不超过两向量范数之积,且等号精确刻画线性相关。 ,
E e | X − E X | / ( 2 K ) ≤ e | E X | / ( 2 K ) E e | X | / ( 2 K ) ≤ 2 E e | X | / K ≤ 2. 所以中心化后可用 2 K 。这只是统一上界,不是最优值,也不表示一个估计出来的均值可以无误差地代替真实均值。
直觉
从 ψ₁ 到局部指数矩
下面令 Y 已中心化,且已验证 E e | Y | / K ≤ 2 。对 | λ | K < 1 ,式 (3) 控制指数级数,E Y = 0 消去一次项:
E e λ Y ≤ 1 + ∑ p = 2 ∞ | λ | p E | Y | p p ! ≤ 1 + 2 K 2 λ 2 1 − K | λ | . 级数绝对可积是因为 e | λ Y | ≤ e | Y | / K 。再用 log ( 1 + u ) ≤ u ,得到
(4) log E e λ Y ≤ ν 2 λ 2 2 ( 1 − b | λ | ) , | λ | < 1 / b , 其中可取 ν 2 = 4 K 2 , b = K 。ν 表示局部二次尺度,b 限制指数参数能走多远;它们与 ψ₁ 尺度不是三个可以互换的同义记号。对具体分布直接算 矩母函数 理路 矩母函数 Moment-generating function · MGF 在存在邻域内以 E[e^{tX}] 编码随机变量各阶矩的函数。 ,往往可以得到更好的 ( ν 2 , b ) 。
与次高斯的关键差别在参数范围:式 (4) 只在零点附近成立。把它延长到所有实 λ ,就暗中添加了更强假设。
独立和为什么出现两种偏差尺度
设独立中心化 Y i 分别满足式 (4),参数为 ( ν i 2 , b i ) ,令
A = ∑ i ν i 2 > 0 , b = max i b i > 0. 在 0 < λ < 1 / b 中,独立性 理路 独立性 Statistical independence 从概率表理解独立性,区分两两、相互和条件独立,并用可计算反例澄清零协方差与条件均值的限度。 以及 1 − b i λ ≥ 1 − b λ 给出
log E e λ ∑ i Y i ≤ A λ 2 2 ( 1 − b λ ) . Chernoff 方法 理路 Chernoff 方法与 Chernoff 界 Chernoff method · Chernoff bounds 从指数矩与 Markov 不等式推导尾界,给出独立 Bernoulli 和的乘法形式、KL 形式及适用条件。 中选 λ = t / ( A + b t ) < 1 / b ,再对两侧合并,得到对 t > 0 的显式界
(5) Pr ( | ∑ i Y i | ≥ t ) ≤ 2 exp ( − t 2 2 ( A + b t ) ) . 代入与标量 Bernstein 的计算相同:1 − b λ = A / ( A + b t ) ,使负的一次项与正的二次项合成指数 − t 2 / [ 2 ( A + b t ) ] 。本页不是直接假定原始变量有界;式 (4) 才是合法依据。
当 b t ≤ A ,式 (5) 至多为 2 e − t 2 / ( 4 A ) ;当 b t ≥ A ,至多为 2 e − t / ( 4 b ) 。小偏差使用局部的二次指数矩,大偏差受到有限参数范围的限制。两段是在解释上界,不意味着变量由“半个高斯和半个指数”混合而成。
例子与边界
指数等待时间:每个参数都能算
设 X ∼ Exp ( a ) ,a > 0 为率参数,E X = 1 / a 。对 K > 1 / a ,
E e X / K = a a − 1 / K . 它不超过 2 当且仅当 K ≥ 2 / a ,故 ‖ X ‖ ψ 1 = 2 / a 。另一方面,E e λ X = ∞ 在 λ ≥ a 时成立,所以它不是次高斯。
中心化 Y = X − 1 / a ,设 u = λ / a 。在 | u | < 1 上,
log E e λ Y = − u − log ( 1 − u ) = ∑ p = 2 ∞ u p p ≤ u 2 2 ( 1 − | u | ) . 因此可直接取 ν 2 = 1 / a 2 , b = 1 / a ,比先把原始 ψ₁ 尺度加倍再使用通用常数更紧。这里恰巧 ν 2 等于真实方差,不能据此推断所有分布都如此。
例如 a = 1 、n = 1000 个独立等待时间,要求控制 | X ¯ − 1 | ≥ 0.2 。总和参数为 A = 1000 , b = 1 , t = 200 ,所以式 (5) 给
2 exp ( − 200 2 2 ( 1000 + 200 ) ) = 2 e − 50 / 3 ≈ 1.15555 × 10 − 7 . 对本例的正参数 ν 2 = 1 / a 2 , b = 1 / a ,如果目标是均值绝对误差 ε > 0 、失败概率 0 < δ < 1 ,相同推导给充分样本量 ⌈ 2 ( ν 2 + b ε ) log ( 2 / δ ) / ε 2 ⌉ 。需要使用这里的局部参数,不能照抄全实数次高斯的样本量。
平方正态为何自然落在这里
若 G ∼ N ( 0 , 1 ) ,则
E e G 2 / K = ( 1 − 2 / K ) − 1 / 2 , K > 2. 令它不超过 2 ,解得 ‖ G 2 ‖ ψ 1 = 8 / 3 。更一般地,按 ψ₂ 与 ψ₁ 的定义直接比较可得
‖ Z 2 ‖ ψ 1 = ‖ Z ‖ ψ 2 2 . 这是两个 Orlicz 尺度定义之间的精确关系;次高斯页的 MGF 代理 s 并不等于 ‖ Z ‖ ψ 2 ,所以不能进一步未经换算把右侧写成 s 2 。
要估计平方的均值,中心化为 Y = G 2 − 1 。对 | λ | < 1 / 2 ,
log E e λ Y = − λ − 1 2 log ( 1 − 2 λ ) ≤ λ 2 1 − 2 | λ | . 可取 ν 2 = 2 , b = 2 。平方损失因此有可计算的两尺度尾界,但不是原来误差变量的同一个高斯尾。若只知道原始误差有有限方差,平方损失的均值虽存在,其方差却可能无穷;连本页的 ψ₁ 条件都不能自动保证。
与重尾类 S 的两次对照
率一指数分布属于本页 ψ₁ 类,但若 X , Y 独立同分布,则
Pr ( X + Y > x ) = e − x ( 1 + x ) , Pr ( X + Y > x ) Pr ( X > x ) = 1 + x → ∞ . 重尾次指数类 S 要求这个比值趋向 2 。所以指数分布并不属于那个同名类别。
反向例子取 Pr ( X > x ) = x − 3 ,x ≥ 1 的 Pareto 分布。它的正则变化尾使 X ∈ S ,详细证明在旧页;但任意 K > 0 下的积分 ∫ 1 ∞ 3 x − 4 e x / K d x 发散,所以 ‖ X ‖ ψ 1 = ∞ 。它甚至有有限方差,说明这里的障碍不是“均值根本不存在”,而是正指数矩不存在。
因此查到英文 subexponential 时,应先看作者在谈卷积尾比,还是绝对值的指数矩。两种用法不能共用一条未消歧的定义或同一个保证。
推论与应用
两道练习
令 X ∼ Exp ( 2 ) 。求 ‖ X ‖ ψ 1 、中心化后的合法 ( ν 2 , b ) ,再计算以误差 0.1 、失败概率 0.01 估计均值的充分样本量。
若 G 1 , … , G n 独立标准正态,想用平均平方估计 1 ,要求误差 0.2 、失败概率 0.01 。按本页平方正态参数算样本量;解释为什么不能因为 G i 次高斯,就对 G i 2 使用同一个 s = 1 。
核对:第一题 ‖ X ‖ ψ 1 = 1 ,ν 2 = 1 / 4 , b = 1 / 2 ,样本量为 ⌈ 60 log 200 ⌉ = 318 。第二题 ν 2 = 2 , b = 2 ,样本量为 ⌈ 120 log 200 ⌉ = 636 ;平方后正指数矩在 λ ≥ 1 / 2 发散,已经不满足全实参数的次高斯定义。
参考资料