Skip to content

定义Definition

次指数尾随机变量(ψ₁)

Sub-exponential random variable (Orlicz) · Psi-1 random variable · ψ₁ 次指数尾

用绝对值指数矩定义 ψ₁ 尺度,推导局部 MGF 与两尺度和界,并以指数分布和 Pareto 尾辨析同名的重尾卷积类。

正态测量误差的平方不再是次高斯,却仍有可用的指数尾。平方损失、随机乘积和等待时间常把我们带到这个中间层:尾比高斯重,但还没有重到丢掉所有正指数矩。

这里的“次指数尾”指集中不等式中的 ψ₁ 类。本站另有 次指数分布,研究重尾和中的“一次大跳”;那是卷积尾类 S。两者共享英文词,不共享定义。本页保留 ψ₁ 标签,避免把这个差别藏进标题。

形式陈述 ​

一份可计算的指数尺度 ​

对实随机变量 X,定义

(1)‖X‖ψ1=inf{K>0:Ee|X|/K≤2},

空集的下确界记为 ∞。若这个量有限,称 X 具有 ψ₁ 次指数尾。实际推导时采用某个已验证满足 Ee|X|/K≤2 的 K>0,不必先找到最小值。

这个定义不要求零均值。它把中心位置也算入尺度,所以与中心化 次高斯尺度 的平移约定不同。处理偏离均值的概率之前,应先写清自己控制的是 X 还是 X−EX。

由 Markov 不等式,对每个 t≥0,

(2)Pr(|X|≥t)≤2e−t/K.

同样,利用 Tonelli 将非负尾积分交换次序,对每个整数 p≥1 得

(3)E|X|p=p∫0∞tp−1Pr(|X|>t)dt≤2Kpp!.

尤其均值与所有整数阶矩都存在。反过来,若已经知道式 (2) 对某个 K 成立,尾积分给

Ee|X|/(3K)=1+∫1∞Pr(|X|>3Klog⁡u)du≤1+2∫1∞u−3du=2.

因此指数型尾上界也给 ψ₁ 尺度,但换算中付出了常数 3。不能在不同定义之间迁移时默认尺度完全相同。

中心化要支付多少尺度 ​

若 Ee|X|/K≤2,Jensen 不等式给出 E|X|≤Klog⁡2,故 |EX|≤Klog⁡2。再由 Cauchy–Schwarz,

Ee|X−EX|/(2K)≤e|EX|/(2K)Ee|X|/(2K)≤2Ee|X|/K≤2.

所以中心化后可用 2K。这只是统一上界,不是最优值,也不表示一个估计出来的均值可以无误差地代替真实均值。

直觉

从 ψ₁ 到局部指数矩 ​

下面令 Y 已中心化,且已验证 Ee|Y|/K≤2。对 |λ|K<1,式 (3) 控制指数级数,EY=0 消去一次项:

EeλY≤1+∑p=2∞|λ|pE|Y|pp!≤1+2K2λ21−K|λ|.

级数绝对可积是因为 e|λY|≤e|Y|/K。再用 log⁡(1+u)≤u,得到

(4)log⁡EeλY≤ν2λ22(1−b|λ|),|λ|<1/b,

其中可取 ν2=4K2,b=K。ν 表示局部二次尺度,b 限制指数参数能走多远;它们与 ψ₁ 尺度不是三个可以互换的同义记号。对具体分布直接算 矩母函数,往往可以得到更好的 (ν2,b)。

与次高斯的关键差别在参数范围:式 (4) 只在零点附近成立。把它延长到所有实 λ,就暗中添加了更强假设。

独立和为什么出现两种偏差尺度 ​

设独立中心化 Yi 分别满足式 (4),参数为 (νi2,bi),令

A=∑iνi2>0,b=maxibi>0.

在 0<λ<1/b 中,独立性以及 1−biλ≥1−bλ 给出

log⁡Eeλ∑iYi≤Aλ22(1−bλ).

Chernoff 方法中选 λ=t/(A+bt)<1/b,再对两侧合并,得到对 t>0 的显式界

(5)Pr(|∑iYi|≥t)≤2exp⁡(−t22(A+bt)).

代入与标量 Bernstein 的计算相同:1−bλ=A/(A+bt),使负的一次项与正的二次项合成指数 −t2/[2(A+bt)]。本页不是直接假定原始变量有界;式 (4) 才是合法依据。

当 bt≤A,式 (5) 至多为 2e−t2/(4A);当 bt≥A,至多为 2e−t/(4b)。小偏差使用局部的二次指数矩,大偏差受到有限参数范围的限制。两段是在解释上界,不意味着变量由“半个高斯和半个指数”混合而成。

例子与边界

指数等待时间:每个参数都能算 ​

设 X∼Exp(a),a>0 为率参数,EX=1/a。对 K>1/a,

EeX/K=aa−1/K.

它不超过 2 当且仅当 K≥2/a,故 ‖X‖ψ1=2/a。另一方面,EeλX=∞ 在 λ≥a 时成立,所以它不是次高斯。

中心化 Y=X−1/a,设 u=λ/a。在 |u|<1 上,

log⁡EeλY=−u−log⁡(1−u)=∑p=2∞upp≤u22(1−|u|).

因此可直接取 ν2=1/a2,b=1/a,比先把原始 ψ₁ 尺度加倍再使用通用常数更紧。这里恰巧 ν2 等于真实方差,不能据此推断所有分布都如此。

例如 a=1、n=1000 个独立等待时间,要求控制 |X¯−1|≥0.2。总和参数为 A=1000,b=1,t=200,所以式 (5) 给

2exp⁡(−20022(1000+200))=2e−50/3≈1.15555×10−7.

对本例的正参数 ν2=1/a2,b=1/a,如果目标是均值绝对误差 ε>0、失败概率 0<δ<1,相同推导给充分样本量 ⌈2(ν2+bε)log⁡(2/δ)/ε2⌉。需要使用这里的局部参数,不能照抄全实数次高斯的样本量。

平方正态为何自然落在这里 ​

若 G∼N(0,1),则

EeG2/K=(1−2/K)−1/2,K>2.

令它不超过 2,解得 ‖G2‖ψ1=8/3。更一般地,按 ψ₂ 与 ψ₁ 的定义直接比较可得

‖Z2‖ψ1=‖Z‖ψ22.

这是两个 Orlicz 尺度定义之间的精确关系;次高斯页的 MGF 代理 s 并不等于 ‖Z‖ψ2,所以不能进一步未经换算把右侧写成 s2。

要估计平方的均值,中心化为 Y=G2−1。对 |λ|<1/2,

log⁡EeλY=−λ−12log⁡(1−2λ)≤λ21−2|λ|.

可取 ν2=2,b=2。平方损失因此有可计算的两尺度尾界,但不是原来误差变量的同一个高斯尾。若只知道原始误差有有限方差,平方损失的均值虽存在,其方差却可能无穷;连本页的 ψ₁ 条件都不能自动保证。

与重尾类 S 的两次对照 ​

率一指数分布属于本页 ψ₁ 类,但若 X,Y 独立同分布,则

Pr(X+Y>x)=e−x(1+x),Pr(X+Y>x)Pr(X>x)=1+x→∞.

重尾次指数类 S 要求这个比值趋向 2。所以指数分布并不属于那个同名类别。

反向例子取 Pr(X>x)=x−3,x≥1 的 Pareto 分布。它的正则变化尾使 X∈S,详细证明在旧页;但任意 K>0 下的积分 ∫1∞3x−4ex/Kdx 发散,所以 ‖X‖ψ1=∞。它甚至有有限方差,说明这里的障碍不是“均值根本不存在”,而是正指数矩不存在。

因此查到英文 subexponential 时,应先看作者在谈卷积尾比,还是绝对值的指数矩。两种用法不能共用一条未消歧的定义或同一个保证。

推论与应用

两道练习 ​

  1. 令 X∼Exp(2)。求 ‖X‖ψ1、中心化后的合法 (ν2,b),再计算以误差 0.1、失败概率 0.01 估计均值的充分样本量。
  2. 若 G1,…,Gn 独立标准正态,想用平均平方估计 1,要求误差 0.2、失败概率 0.01。按本页平方正态参数算样本量;解释为什么不能因为 Gi 次高斯,就对 Gi2 使用同一个 s=1。

核对:第一题 ‖X‖ψ1=1,ν2=1/4,b=1/2,样本量为 ⌈60log⁡200⌉=318。第二题 ν2=2,b=2,样本量为 ⌈120log⁡200⌉=636;平方后正指数矩在 λ≥1/2 发散,已经不满足全实参数的次高斯定义。

参考资料
关系图谱12 个相邻概念 · 4 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

暂未标注直接上位概念。

下位 / 直接特例

类型化关系