“概率论的偏差不等式常从选择不同的非负变换开始:平方变换给出 Chebyshev 不等式;指数变换及其参数优化由Chernoff 方法集中处理,矩母函数在其中提供尾部信息。PAC Bayes…”
形式陈述 ​
实随机变量公理库随机变量Random variable · Random element从概率空间到可测取值空间的可测映射;实值情形承载数值概率运算。
定义域为使该期望公理库期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。有限的全体
此时
直觉
指数函数是一台"矩打包机":把
例子与边界
正态分布公理库正态分布Normal distribution · Gaussian distribution · 高斯分布具有指数平方密度、在仿射变换与独立求和下封闭的概率分布族。
反例划出适用边界。Cauchy 分布连
Poisson 分布公理库Poisson 分布Poisson distribution · 泊松分布以强度参数描述固定窗口内稀有事件计数的离散分布。把乘法性质展示得最直接:
推论与应用
MGF 的第一用途是计算与识别:逐阶求导取矩,或从函数形状直接认出分布——独立正态和的 MGF 仍是正态型、独立 Poisson 和仍是 Poisson 型。第二用途是为Chernoff 方法公理库Chernoff 方法与 Chernoff 界Chernoff method · Chernoff bounds对随机变量施加指数变换并优化参数,以获得指数级尾概率上界。提供指数矩接口;从指数 Markov 模板到参数优化与 Bernoulli 和的闭式界,都由该页统一陈述。对独立坐标的低敏感函数,有界差分不等式公理库有界差分不等式McDiarmid inequality · 有界差异不等式独立输入的函数若对单个坐标不敏感,其输出便以次高斯速度集中在期望附近。沿 Doob 鞅逐步控制条件指数矩,延续的是同一“指数矩换尾界”思路,而不是假定目标函数本身有一个普通单变量 MGF。
在正则指数族中,log-partition 函数本质上是自然统计量的对数 MGF,其梯度和 Hessian 给均值与协方差;标准
第三用途是极限定理:当各 MGF 在公共邻域内有限时,逐点收敛到某分布的 MGF 蕴含依分布收敛公理库依分布收敛Convergence in distribution · Weak convergence分布函数在极限分布连续点处收敛的随机变量收敛概念。,中心极限定理公理库中心极限定理Central limit theorem适当归一化的独立随机变量和在分布上趋于正态分布。的初等证明正是对标准化和的矩母函数做 Taylor 展开取极限。Hedge公理库指数权重与 HedgeHedge algorithm · exponential weights在全信息有界损失下按累计损失指数加权,并取得平方根级专家 regret。也使用指数和与 log-sum-exp 势函数,但其中对专家索引的加权和是算法势能,不是某个随机变量的矩母函数;两者共享指数凸性技巧,不共享定义。
参考资料
- Patrick Billingsley, Probability and Measure, 3rd ed., Wiley, 1995,Ch. 4, transforms and moments of random variables。
- Sheldon Ross, A First Course in Probability, 10th ed., Pearson, 2019,Chs. 7–8, moment-generating functions and sums。