知道均值和方差吻合,还不能知道某个有限样本统计量离正态有多近。Stein方程为每个要比较的测试函数h配一个辅助函数f:比较两种分布下h的期望,变成检查一个微分恒等式偏离了多少。后续方法再利用原随机模型的结构控制这份偏离。
形式陈述
标准正态满足的恒等式
记 ,其密度理路正态分布Normal distribution · Gaussian distribution · 高斯分布具有指数平方密度、在仿射变换与独立求和下封闭的概率分布族。和分布函数为φ与Φ。若f连续可微且f、f′均有界,分部积分给
因为 ,且有界f保证 ,没有未处理的无穷端点项。
反过来,若 ,并且W对所有这样的f满足式(1),则W服从标准正态。下面的方程解会证明这一方向,而不是只检验有限个矩。
对每个Lipschitz目标求一个方程
设 为1-Lipschitz函数,即 。h可以无界,但至多线性增长,因此 存在。考虑
它的唯一有界解为
两个积分相等是因为被积函数在整条实轴上的积分为零。直接求导给式(2)。两个解之差满足 ,故为 ;有界性迫使C=0。
这个解满足
最后一项也可写成几乎处处 ,并且f′局部绝对连续。h不必处处可微,不能把这个结论误写成处处存在经典二阶导数。
误差的精确入口
对有限一阶矩W,以 记其分布到标准正态的一阶Wasserstein距离理路Wasserstein 距离Wasserstein distance用最小平均搬运距离定义概率测度的度量,并用矩条件说明它比弱收敛多控制什么。。则
式(4)保证右边期望绝对可积。后续的交换对理路交换对的正态近似Exchangeable pair normal approximation · Stein pair · Stein交换对用一次可逆的随机扰动构造交换对,把线性条件回归、条件跳跃方差和三阶跳跃量变成有限样本Wasserstein误差预算。与零偏置理路零偏置分布与正态耦合Zero bias distribution · Zero-bias coupling · 零偏置耦合通过中心变量的二阶加权积分构造连续的新分布,按方差替换独立和的一项,并以耦合距离控制Lipschitz损失的正态误差。分别把 改写成可以和 比较的形式。
直觉
一个函数h只问一个问题,例如h(x)=max(x,0)衡量超出中心后的平均负荷。式(2)把这个问题翻译成对正态恰好为零的量f′−xf。原模型的这个量若很小,原来的平均负荷就接近正态答案。
关键是对所有1-Lipschitz的h,辅助函数都共享式(4)中的常数。我们不需要先知道哪一个h最难比较;只要结构性估计对这一整族f都成立,就得到统一的距离界。
为什么这里的测试族恰对应W1
设X、Y有有限一阶矩,分布函数为 。Lipschitz函数绝对连续,几乎处处 。将 写成从0到x的积分,再用Fubini换序理路Fubini 定理Fubini's theorem在适当可积条件下,多重积分等于任意次序的迭代积分。,得到
绝对可积性可由 控制,因此这里的换序不会隐藏条件收敛。式(6)的绝对值至多为CDF差的绝对面积。反向取
它是1-Lipschitz并达到该面积。一维单调输运理路一维单调输运Monotone rearrangement transport · Quantile transport按累计质量的相同分位数配对,以消除交叉证明一维凸距离成本的最优性。已经证明这一面积恰为W1,故
对Y=Z再代入式(2),便得式(5)。若W满足式(1),右边为零,因W1为距离而有 ,补全正态刻画。
例子与边界
两个可直接检验的辅助函数
当h(x)=x时,,式(2)的有界解为f(x)=−1。于是误差恰为EW;式(4)的第一个常数1可以取到。
当h(x)=|x|时,。对称性给f(0)=0,方程又给
因此第二个常数也不能任意缩小。这个h在零点有折角,但f仍连续可微;f′的Lipschitz控制正是为这类目标准备的。
若W在−1和1上各有一半概率,它与Z的均值、方差完全相同,但 ,所以
只匹配前两个矩没有让式(5)中所有测试都消失。
离散近似不能换用总变差结论
任何离散W的支撑都是可数集合A,,而连续正态对A的概率为零。所以二者的总变差距离始终为1,即使W是越来越长的标准化独立和,W1趋向零。
W1界ε控制L-Lipschitz目标的期望误差为Lε,却不直接把每个事件的概率误差都控制成ε。阶跃指示函数不是Lipschitz;如要转换为分布函数界,需要额外平滑和反集中步骤。本页没有悄悄声称一个Berry–Esseen的Kolmogorov界。
平移、缩放与标准化
如果希望用 、σ>0近似X,应先对 使用本页。W1按长度缩放:
均值零、方差一是交换对和零偏置近似定理中的常见假设,不是任意有限一阶矩W都自动具有的性质。若σ=0,目标是点质量,不能除以σ套用本页的标准化接口。
推论与应用
解界的证明:把符号不明的积分拆成非负核
Lipschitz的h几乎处处有导数且 。记 ,并设
把 表为h′的积分后,对式(3)换序,得到
这一步的两个核都非负,且
因 ,直接相乘得 ,故 。
再用 。式(7)求一次导时,含h′的两项恰好抵消,因而 。再在几乎处处求导,得
核的二阶导数是非负的:例如
而b(x)=a(−x)。由 算得 。于是 。A、B局部绝对连续,使f′也局部绝对连续;积分这个几乎处处界,得到式(4)中的全域Lipschitz结论。
一阶导数的Gaussian平滑界
先设h光滑而 ,并令
直接求导并对Z作Gaussian分部积分,可核
因同一Z下的输入趋向Z,Lipschitz性给 。因此积分有限;令 ,其导数
满足 ,并有界,故就是式(3)的解。再对Gaussian密度积分而非要求h′有统一二阶界,得到
最后用 逼近一般Lipschitz h。它保持同一个Lipschitz常数,且全域 。式(3)使解在紧集上收敛,再由式(2)使导数也在紧集上收敛;统一一阶导数界因此保留下来。以上证明只用了显式Gaussian积分,没有要求读者先接受一个扩散过程模型。
式(3)是一条分析表达式,直接用浮点计算极端尾部的“小积分除以小密度”可能不稳定。实际误差证明通常只调用式(4)的常数,不需要逐点数值求f。若确实要评估f,必须另行选择稳定的尾比率或积分算法,不能把方程解的存在当作某个固定计算成本承诺。
参考资料