形式陈述
Chernoff 方法给出指数上界,但它是否已经抓住真实概率的指数阶?Cramér 定理的新增内容,是在合适指数矩条件下补出匹配的下界。
设实随机变量 X 1 , X 2 , … 组成独立同分布样本 公理库 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 ,X ― n = n − 1 ∑ i X i 。令
Λ ( θ ) = log E e θ X 1 , I ( x ) = sup θ ∈ R { θ x − Λ ( θ ) } . 若矩母函数 公理库 矩母函数 Moment-generating function · MGF 在存在邻域内以 E[e^{tX}] 编码随机变量各阶矩的函数。 在零的某个开邻域内有限,则 X ― n 在 R 上以速度 n 、良速率函数 I 满足大偏差原理 公理库 大偏差原理 Large deviation principle · LDP 用开集下界和闭集上界刻画概率的指数衰减,区分速率函数、拓扑与精确概率。 。这里 I 是 Λ 的凸共轭 公理库 凸共轭与 Fenchel–Young 不等式 Convex conjugate · Fenchel conjugate · Fenchel–Young inequality 以线性函数的最佳配对代价定义共轭,并导出原变量与对偶变量间的基本不等式。 ,采用实直线上的通常乘积配对。允许其他参数处 Λ ( θ ) = ∞ ,这些参数不参与有限值优化。所有对数均为自然对数。
直觉
指数上界惩罚异常值;下界则换一个抽样规律,让原来的异常值成为新规律的平均值。然后计算从新规律换回原规律所付出的似然比,便看到这个异常事件确实需要、也只需要大约 n I ( x ) 的指数成本。
若某个内点参数 θ 满足 Λ ′ ( θ ) = x ,定义倾斜分布
d P θ ( y ) = e θ y − Λ ( θ ) d P ( y ) . 在该分布下,零附近的指数矩为 e Λ ( θ + t ) − Λ ( θ ) ,因而一阶绝对矩有限、平均值为 x 。对倾斜后的 IID 样本使用强大数定律 公理库 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 ,得到 P θ ( | X ― n − x | < δ ) → 1 。换回原分布,在该事件上有
P ( | X ― n − x | < δ ) ≥ e − n ( θ x − Λ ( θ ) + | θ | δ ) P θ ( | X ― n − x | < δ ) . 取对数、除以 n ,再让 δ ↓ 0 ,得到局部下界。一般边界点或不能直接表示为导数的点,需要凸性与截断逼近来完成证明;不能在矩母函数域外随意解导数方程。上界由Chernoff 方法 公理库 Chernoff 方法与 Chernoff 界 Chernoff method · Chernoff bounds 从指数矩与 Markov 不等式推导尾界,给出独立 Bernoulli 和的乘法形式、KL 形式及适用条件。 、有限覆盖与指数紧性 公理库 指数紧性 Exponential tightness 以任意强度的指数尾控制质量逃向无穷,将紧集上界升级为所有闭集上界。 给出。
例子与边界
令 X i ∼ Bernoulli ( p ) ,0 < p < 1 。则 Λ ( θ ) = log ( 1 − p + p e θ ) 。对 0 < q < 1 ,令导数等于 q ,得到
e θ q = q ( 1 − p ) p ( 1 − q ) , I ( q ) = q log q p + ( 1 − q ) log 1 − q 1 − p = D ( q ‖ p ) . 倾斜后的 P θ q 恰为 Bernoulli( q ) 。因此在原来的 Bernoulli( p ) 世界里稀有的“平均值接近 q ”,在新世界里以概率趋于一发生。上面的似然比下界把它带回去,证明相对熵不只是某个方便的上界指数,而是实际的大偏差成本。
在 q = 1 ,事件“所有样本都为一”概率为 p n ,直接给出 I ( 1 ) = − log p ;q = 0 同理得到 − log ( 1 − p ) 。区间外不可能发生,速率为 ∞ 。不能把趋于无穷的倾斜参数当作有限数代回导数式来跳过端点检查。
对 p < q < 1 ,I 在 [ q , 1 ] 上的最小值为 I ( q ) ,而开尾 ( q , 1 ] 可由靠近 q 的点逼近。因此 LDP 的上下界合拢,得到 n − 1 log P ( X ― n ≥ q ) → − D ( q ‖ p ) 。但单点 { q } 可能因 n q 不是整数而概率为零,所以不能照抄尾事件的等式。
若服务时长或损失具有正则变化重尾 公理库 正则变化函数 Regularly varying function · Regular variation 正则变化以缩放比值的幂函数极限刻画幂律,允许不改变幂指数的慢变化修正。 ,虽可能有有限方差,却没有零附近的有限正指数矩,本定理的假设不满足。对于固定项数的独立非负和,次指数分布 公理库 次指数分布 Subexponential distribution · Principle of a single big jump 次指数重尾的固定有限和超过高门槛时,主要由一个分量单独超过门槛造成,其和尾渐近为单项尾的项数倍。 以卷积尾等价精确表达“一次大跳”机制;要再让项数随门槛增长,需要额外的统一控制。中央极限定理成立并不能替代这里的指数矩条件。
推论与应用
指数倾斜也能用于稀有事件仿真,但必须保留似然比才能无偏地估计原概率。若研究非 IID 序列,可尝试Gärtner–Ellis 定理 公理库 Gärtner–Ellis 定理 Gartner-Ellis theorem 从极限对数矩母函数导出大偏差,但以可微性和陡峭性保证匹配下界。 ;仅存在极限对数矩母函数时,匹配下界仍需要额外的光滑性与边界条件。
参考资料