Skip to content

定义Definition

局部渐近正态性

Local asymptotic normality · LAN

在根号 n 局部尺度上把对数似然比展开为高斯随机线性项与信息二次项,并完整计算 Bernoulli 模型的两种局部极限。

形式陈述 ​

设 {Pθ(n):θ∈Θ} 是随样本量 n 变化的一族统计实验,θ0 是 Θ⊂R 的内点。这里 Pθ(n) 是全部观测的联合分布;它可以是 IID 乘积分布,定义本身并不要求 IID。对每个固定的实数 h,考虑趋近 θ0 的参数

θn,h=θ0+hn.

假定充分大的 n 下局部似然比 dPθn,h(n)/dPθ0(n) 存在。在本页采用的非退化版本中,若存在常数 0<I<∞ 及同一个随机序列 Δn,使每个固定 h 都满足

log⁡dPθ0+h/n(n)dPθ0(n)=hΔn−12h2I+rn(h),rn(h)=oPθ0(n)(1),

且在 Pθ0(n) 下有依分布收敛

Δn⇒N(0,I),

则称该实验在 θ0 处、根号 n 尺度下具有局部渐近正态性,简称 LAN。Δn 称为中心序列。余项记号表示:对任意 ε>0,Pθ0(n)(|rn(h)|>ε)→0;概率律随 n 改变也包含在这个记号中。

同一个 Δn 要同时服务于所有固定局部方向 h,不能对每个 h 各找一个无关的正态变量。在正则 IID 模型中,中心序列通常取为归一化得分

Δn=1n∑i=1nsθ0(Xi),I=Eθ0[sθ0(X)2].

得分的方差给出随机线性项的尺度,同一个 I 又出现在确定的负二次项中。这两处系数的一致才形成高斯似然结构;仅有某个统计量的中心极限定理还不够。

固定 h 的定义没有宣称余项在整个有界区间上一致消失。更强的结论

sup|h|≤H|rn(h)|→Pθ0(n)0对每个固定 H<∞

需要另行证明,下面的 Bernoulli 例子会给出显式界。有限维向量版本把 hΔn−h2I/2 换成 hTΔn−hTIh/2,并要求 Δn⇒Nd(0,I);本页取 I 正定以便使用 I−1。允许半正定信息的定义也存在,但不能直接沿用这里的信息逆表示。

直觉

为什么把参数差缩小到根号 n 的倒数 ​

在正则 IID 模型中,n 个零均值得分相加的随机大小约为 n,对数似然的总曲率则约为 nI。把参数移动 h/n 后,一阶变化约为 hΔn,二阶变化约为 −h2I/2,两者都保留常数量级。这个尺度使数据仍能感受到参数变化,却不会让两种模型立即变得完全容易区分。

LAN 的“正态”首先描述整族局部似然比的形状。还没有选取估计量,也没有讨论哪个算法求出了最大值。估计量渐近正态、检验的局部功效和后验的正态近似,都是利用这层似然结构再完成各自证明的后续问题。

高斯位移给出的准确参照 ​

考虑只观察一个变量的实验 Z∼N(h,I−1),以 h=0 为基准。直接相减两个高斯对数密度得到

log⁡fh(Z)f0(Z)=−I2(Z−h)2+I2Z2=hIZ−12h2I.

在基准分布下,IZ∼N(0,I),恰好与 LAN 中的 Δn 对应。因此可以把 I−1Δn 看作高斯位移实验中观测值的局部对应物。这个解释匹配的是局部似然比的极限结构;它本身不是原始全部数据分布与一个高斯分布在总变差距离下等价的断言。

例子与边界

Bernoulli:先把中心序列算出来 ​

令 X1,…,Xn 独立同分布于 Bernoulli(p),参数 p∈(0,1),基准点取 p0=1/3。记 Sn=∑iXi、X¯n=Sn/n。单次观测的对数概率与得分是

ℓp(x)=xlog⁡p+(1−x)log⁡(1−p),sp(x)=xp−1−x1−p.

在 p0 处,sp0(1)=3,sp0(0)=−3/2,于是

Ep0sp0(X)=13⋅3+23(−32)=0,I=13⋅9+23⋅94=92.

中心序列因此为

Δn=1n∑isp0(Xi)=92n(Sn−n3).

得分独立同分布且方差为 9/2,中心极限定理给出基准分布下的 Δn⇒N(0,9/2)。还须控制似然比,才能从这个结论走到 LAN。

展开精确似然比,并控制整个有界区间 ​

令 pn,h=1/3+h/n。充分大的 n 下所有二元样本在两个模型中都有正概率,所以对数似然比精确等于

Ln(h)=Snlog⁡(1+3hn)+(n−Sn)log⁡(1−3h2n).

为避免把余项藏在形式展开中,先固定 H<∞,令 |h|≤H 且 n≥36H2。这样 pn,h 及其与 p0 之间的所有点都落在 [1/6,1/2]。单次对数概率的二阶、三阶导数为

ℓp″(x)=−xp2−1−x(1−p)2,ℓp‴(x)=2xp3−2(1−x)(1−p)3.

因为 x 只能取 0 或 1,上述区间上 |ℓp‴(x)|≤432。对每项使用带三阶余项的Taylor 公式再相加,得到

Ln(h)=hΔn−h22n(9Sn+94(n−Sn))+Rn(h)=hΔn−94h2−278h2(X¯n−13)+Rn(h),

其中逐项相加的确定性界是

sup|h|≤H|Rn(h)|≤n⋅4326(Hn)3=72H3n.

基准分布下 EX¯n=1/3、Var(X¯n)=2/(9n)。由Chebyshev 不等式,X¯n−1/3=OP(n−1/2),其中 OP 表示乘上 n 后依概率有界。于是把最后两项合成 rn(h) 后,

sup|h|≤H|rn(h)|≤27H28|X¯n−13|+72H3n→Pp0(n)0.

至此,线性项、信息二次项和余项三项都已核对,且证明了比固定 h 定义更强的有界区间一致性。对任意固定 h,在基准分布下,

Ln(h)⇒N(−94h2,92h2).

这里及下文在 h=0 时把方差为零的正态理解为零点的退化分布。

真参数也随 n 移动时,重新核对概率律 ​

现在固定 h,让数据实际来自 pn=1/3+h/n。似然比仍是同一个函数 Ln(h),但它的抽样分布已经改变。不能仅把基准分布下的余项收敛和中心极限定理原封不动地搬过来。

先将样本和在真正的均值处中心化:Tn=(Sn−npn)/n。独立性及 Bernoulli 的特征函数给出

EpneitTn=e−itnpn[1+pn(eit/n−1)]n.

对固定的 t,先展开指数,再在 1 附近取连续的对数分支,有

eit/n−1=itn−t22n+O(n−3/2),log⁡[1+pn(eit/n−1)]=itpnn−t2pn(1−pn)2n+O(n−3/2).

因 pn 最终留在 [1/6,1/2],这些余项常数可与 n 无关。乘上 n 后,线性的虚数项被前面的中心化因子消去,故

EpneitTn=exp⁡{−t2pn(1−pn)2+O(n−1/2)}⟶e−t2/9.

由特征函数的连续性定理,Tn⇒N(0,2/9)。同时

Δn=92(Tn+h)⇒N(92h,92).

再看余项:在当前概率律下,Epn(X¯n−1/3)=h/n,Varpn(X¯n)=pn(1−pn)/n≤1/(4n)。所以 X¯n−1/3=OPpn(n)(n−1/2),同一个 Taylor 余项界直接保证 rn(h)→0。这一步是在新概率律下重新证明,没有借用尚未建立的换测度定理。代回展开便得到

Ln(h)⇒N(+94h2,92h2)在 Ppn(n) 下.

两个均值的符号有明确含义:Ln(h) 衡量备择相对基准的证据,数据来自基准时极限偏负,来自该备择时极限偏正;方差在这两个局部极限中相同。

将两个极限放回高斯实验 ​

定义 Zn=I−1Δn=n(X¯n−1/3)。所有系数可以放在同一张表里核对。

数据所来自的参数 Zn 的极限分布 Ln(h) 的极限分布
基准 p0=1/3 N(0,2/9) N(−9h2/4,9h2/2)
局部备择 pn=1/3+h/n N(h,2/9) N(+9h2/4,9h2/2)

对应的高斯实验是 Z∼N(h,2/9),对数密度比为 (9/2)hZ−(9/4)h2。将表中任一行的 Z 分布代入,都恰好得到右栏。因此终点不仅是“样本比例近似正态”,还包括两种数据生成方式下、同一个局部似然比如何变化。

边界点为何不能套用这套计算 ​

若把基准改成 p0=0,样本全为零的概率为一,而任何正的备择参数都会给含有 1 的样本正概率;备择联合分布不再对基准联合分布绝对连续,上面的似然比前提已经失效。得分中的 1/p0 也无定义。此处先辨认支持与尺度,比把 I(p)=1/[p(1−p)] 机械代入边界更有意义。

即使参数在内点,也不能仅凭对数似然二阶可微就宣布 LAN:仍须证明归一化一阶项的高斯极限、二阶项的正确极限以及局部余项消失。二次均值可微是建立正则 IID 模型 LAN 的一条常用充分条件;其一般定理比这里的 Bernoulli 直接计算更广,本页不以一次形式 Taylor 展开代替它的假设。

推论与应用

LAN 为渐近效率提供比较不同估计程序的局部模型。Bernoulli 例中 p^n=X¯n 满足

n(p^n−pn)=Tn⇒N(0,2/9)

对每个固定 h 都成立,且极限不随 h 改变。这既检查了该估计量在局部备择下的正则性,也展示其极限方差 2/9=I−1。一般模型中,LAN 本身不保证任意估计量有效;信息下界还需要估计量的局部正则性及相应下界定理。

在Bernstein–von Mises 定理中,同一展开通过完成平方产生局部后验的候选高斯形状:

hΔn−12Ih2=−I2(h−I−1Δn)2+Δn22I.

最后一项与 h 无关,被后验归一化吸收;其余部分的中心是 I−1Δn,方差是 I−1。要把这个局部形状升级为完整的后验近似,还须保证先验在局部足够平坦,并控制该区域以外的后验质量。LAN 解决局部似然结构,后验集中解决质量会不会逃到远处,两项工作各有作用。

参考资料
  • John Duchi, Stats 300b: Local Asymptotic Normality,Stanford,Winter 2021,幻灯片 14–10 至 14–12、14–17:LAN、二次均值可微与高斯位移。本文 Bernoulli 的显式余项界及两种概率律下的计算在正文直接给出。
  • Peter Bartlett, Theoretical Statistics, Lecture 22,Berkeley Stat 210B,Spring 2013,第 10–12 页:正则 IID 模型中二次均值可微导出局部似然展开的定理与条件;这里不把该陈述当作有界区间一致余项定理。
关系图谱20 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系