Skip to content

方法Method

正态Stein方程与误差接口

Normal Stein equation · Gaussian Stein equation · Stein factors for normal approximation

将正态近似化为一个可计算的期望缺口,证明Lipschitz测试对应的解及导数常数,并保留Wasserstein与总变差的区别。

知道均值和方差吻合,还不能知道某个有限样本统计量离正态有多近。Stein方程为每个要比较的测试函数h配一个辅助函数f:比较两种分布下h的期望,变成检查一个微分恒等式偏离了多少。后续方法再利用原随机模型的结构控制这份偏离。

形式陈述 ​

标准正态满足的恒等式 ​

记 Z∼N(0,1),其密度和分布函数为φ与Φ。若f连续可微且f、f′均有界,分部积分给

(1)E[f′(Z)−Zf(Z)]=0.

因为 ϕ′(x)=−xϕ(x),且有界f保证 f(x)ϕ(x)→0,没有未处理的无穷端点项。

反过来,若 E|W|<∞,并且W对所有这样的f满足式(1),则W服从标准正态。下面的方程解会证明这一方向,而不是只检验有限个矩。

对每个Lipschitz目标求一个方程 ​

设 h:R→R 为1-Lipschitz函数,即 |h(x)−h(y)|≤|x−y|。h可以无界,但至多线性增长,因此 Eh(Z) 存在。考虑

(2)fh′(x)−xfh(x)=h(x)−Eh(Z).

它的唯一有界解为

(3)fh(x)=1ϕ(x)∫−∞x[h(t)−Eh(Z)]ϕ(t)dt=−1ϕ(x)∫x∞[h(t)−Eh(Z)]ϕ(t)dt.

两个积分相等是因为被积函数在整条实轴上的积分为零。直接求导给式(2)。两个解之差满足 g′=xg,故为 Cex2/2;有界性迫使C=0。

这个解满足

(4)‖fh‖∞≤1,‖fh′‖∞≤2/π,|fh′(x)−fh′(y)|≤2|x−y|.

最后一项也可写成几乎处处 |fh″|≤2,并且f′局部绝对连续。h不必处处可微,不能把这个结论误写成处处存在经典二阶导数。

误差的精确入口 ​

对有限一阶矩W,以 dW 记其分布到标准正态的一阶Wasserstein距离。则

(5)dW(W,Z)=supLip(h)≤1|E[fh′(W)−Wfh(W)]|.

式(4)保证右边期望绝对可积。后续的交换对与零偏置分别把 E[Wf(W)] 改写成可以和 Ef′(W) 比较的形式。

直觉

一个函数h只问一个问题,例如h(x)=max(x,0)衡量超出中心后的平均负荷。式(2)把这个问题翻译成对正态恰好为零的量f′−xf。原模型的这个量若很小,原来的平均负荷就接近正态答案。

关键是对所有1-Lipschitz的h,辅助函数都共享式(4)中的常数。我们不需要先知道哪一个h最难比较;只要结构性估计对这一整族f都成立,就得到统一的距离界。

为什么这里的测试族恰对应W1 ​

设X、Y有有限一阶矩,分布函数为 FX,FY。Lipschitz函数绝对连续,几乎处处 |h′|≤1。将 h(x)−h(0) 写成从0到x的积分,再用Fubini换序,得到

(6)Eh(X)−Eh(Y)=∫Rh′(t)[FY(t)−FX(t)]dt.

绝对可积性可由 E|X|+E|Y|<∞ 控制,因此这里的换序不会隐藏条件收敛。式(6)的绝对值至多为CDF差的绝对面积。反向取

h(x)=∫0xsgn(FY(t)−FX(t))dt,

它是1-Lipschitz并达到该面积。一维单调输运已经证明这一面积恰为W1,故

dW(X,Y)=supLip(h)≤1|Eh(X)−Eh(Y)|.

对Y=Z再代入式(2),便得式(5)。若W满足式(1),右边为零,因W1为距离而有 L(W)=L(Z),补全正态刻画。

例子与边界

两个可直接检验的辅助函数 ​

当h(x)=x时,Eh(Z)=0,式(2)的有界解为f(x)=−1。于是误差恰为EW;式(4)的第一个常数1可以取到。

当h(x)=|x|时,Eh(Z)=2/π。对称性给f(0)=0,方程又给

f′(0)=−2/π.

因此第二个常数也不能任意缩小。这个h在零点有折角,但f仍连续可微;f′的Lipschitz控制正是为这类目标准备的。

若W在−1和1上各有一半概率,它与Z的均值、方差完全相同,但 E|W|=1≠2/π,所以

dW(W,Z)≥1−2/π>0.

只匹配前两个矩没有让式(5)中所有测试都消失。

离散近似不能换用总变差结论 ​

任何离散W的支撑都是可数集合A,P(W∈A)=1,而连续正态对A的概率为零。所以二者的总变差距离始终为1,即使W是越来越长的标准化独立和,W1趋向零。

W1界ε控制L-Lipschitz目标的期望误差为Lε,却不直接把每个事件的概率误差都控制成ε。阶跃指示函数不是Lipschitz;如要转换为分布函数界,需要额外平滑和反集中步骤。本页没有悄悄声称一个Berry–Esseen的Kolmogorov界。

平移、缩放与标准化 ​

如果希望用 N(μ,σ2)、σ>0近似X,应先对 W=(X−μ)/σ 使用本页。W1按长度缩放:

dW(X,μ+σZ)=σdW(W,Z).

均值零、方差一是交换对和零偏置近似定理中的常见假设,不是任意有限一阶矩W都自动具有的性质。若σ=0,目标是点质量,不能除以σ套用本页的标准化接口。

推论与应用

解界的证明:把符号不明的积分拆成非负核 ​

Lipschitz的h几乎处处有导数且 ‖h′‖∞≤1。记 Φ¯=1−Φ,并设

a(x)=Φ¯(x)ϕ(x),b(x)=Φ(x)ϕ(x),A(x)=∫−∞xΦ(u)h′(u)du,B(x)=∫x∞Φ¯(u)h′(u)du.

把 h(t)−h(s) 表为h′的积分后,对式(3)换序,得到

(7)fh=−aA−bB.

这一步的两个核都非负,且

A0(x):=∫−∞xΦ(u)du=xΦ(x)+ϕ(x),B0(x):=∫x∞Φ¯(u)du=ϕ(x)−xΦ¯(x).

因 |A|≤A0,|B|≤B0,直接相乘得 aA0+bB0=1,故 |fh|≤1。

再用 a′=xa−1,b′=xb+1。式(7)求一次导时,含h′的两项恰好抵消,因而 fh′=−a′A−b′B。再在几乎处处求导,得

fh″=h′−a″A−b″B.

核的二阶导数是非负的:例如

a(x)=∫0∞e−xt−t2/2dt,a″(x)=∫0∞t2e−xt−t2/2dt≥0,

而b(x)=a(−x)。由 a″=(1+x2)a−x,b″=(1+x2)b+x 算得 a″A0+b″B0=1。于是 |fh″|≤1+1=2。A、B局部绝对连续,使f′也局部绝对连续;积分这个几乎处处界,得到式(4)中的全域Lipschitz结论。

一阶导数的Gaussian平滑界 ​

先设h光滑而 |h′|≤1,并令

Pth(x)=E[h(e−tx+1−e−2tZ)].

直接求导并对Z作Gaussian分部积分,可核

∂tPth=∂xxPth−x∂xPth.

因同一Z下的输入趋向Z,Lipschitz性给 |Pth(x)−Eh(Z)|≤e−t|x|+e−2tE|Z|。因此积分有限;令 u(x)=−∫0∞(Pth(x)−Eh(Z))dt,其导数

fh(x)=u′(x)=−∫0∞e−tE[h′(e−tx+1−e−2tZ)]dt

满足 u″−xu′=h−Eh(Z),并有界,故就是式(3)的解。再对Gaussian密度积分而非要求h′有统一二阶界,得到

|fh′(x)|≤E|Z|∫0∞e−2t1−e−2tdt=2/π.

最后用 hε(x)=E[h(x+εZ)] 逼近一般Lipschitz h。它保持同一个Lipschitz常数,且全域 |hε−h|≤εE|Z|。式(3)使解在紧集上收敛,再由式(2)使导数也在紧集上收敛;统一一阶导数界因此保留下来。以上证明只用了显式Gaussian积分,没有要求读者先接受一个扩散过程模型。

式(3)是一条分析表达式,直接用浮点计算极端尾部的“小积分除以小密度”可能不稳定。实际误差证明通常只调用式(4)的常数,不需要逐点数值求f。若确实要评估f,必须另行选择稳定的尾比率或积分算法,不能把方程解的存在当作某个固定计算成本承诺。

参考资料
  • Charles Stein,Approximate Computation of Expectations,IMS Lecture Notes–Monograph Series 7,1986;正态刻画、辅助随机化与方程方法。
  • Robert E. Gaunt,On Stein Factors in Stein’s Method for Normal Approximation,2024原稿,§1式(1.1)–(1.4)及其后关于改进到 ‖fh‖≤‖h′‖ 的说明。本页给出CDF核和Gaussian平滑的完整一维证明。
  • Nathan Ross,Fundamentals of Stein’s Method,§2、Lemma2.5与Theorem3.1;Wasserstein测试族及方程缺口。本页明确区分原文的部分较宽常数与式(4)实际证明的常数。
关系图谱13 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系