形式陈述
设 是随样本量 变化的一族统计实验, 是 的内点。这里 是全部观测的联合分布;它可以是 IID 乘积分布,定义本身并不要求 IID。对每个固定的实数 ,考虑趋近 的参数
假定充分大的 下局部似然比 存在。在本页采用的非退化版本中,若存在常数 及同一个随机序列 ,使每个固定 都满足
且在 下有依分布收敛公理库依分布收敛Convergence in distribution · Weak convergence分布函数在极限分布连续点处收敛的随机变量收敛概念。
则称该实验在 处、根号 尺度下具有局部渐近正态性,简称 LAN。 称为中心序列。余项记号表示:对任意 ,;概率律随 改变也包含在这个记号中。
同一个 要同时服务于所有固定局部方向 ,不能对每个 各找一个无关的正态变量。在正则 IID 模型中,中心序列通常取为归一化得分公理库Score 与 Fisher 信息Score function · Fisher information对数似然的局部参数导数、其模型内二次平均,以及零均值和曲率等式成立的正则条件。
得分的方差给出随机线性项的尺度,同一个 又出现在确定的负二次项中。这两处系数的一致才形成高斯似然结构;仅有某个统计量的中心极限定理还不够。
固定 的定义没有宣称余项在整个有界区间上一致消失。更强的结论
需要另行证明,下面的 Bernoulli 例子会给出显式界。有限维向量版本把 换成 ,并要求 ;本页取 正定以便使用 。允许半正定信息的定义也存在,但不能直接沿用这里的信息逆表示。
直觉
为什么把参数差缩小到根号 n 的倒数
在正则 IID 模型中, 个零均值得分相加的随机大小约为 ,对数似然的总曲率则约为 。把参数移动 后,一阶变化约为 ,二阶变化约为 ,两者都保留常数量级。这个尺度使数据仍能感受到参数变化,却不会让两种模型立即变得完全容易区分。
LAN 的“正态”首先描述整族局部似然比的形状。还没有选取估计量,也没有讨论哪个算法求出了最大值。估计量渐近正态、检验的局部功效和后验的正态近似,都是利用这层似然结构再完成各自证明的后续问题。
高斯位移给出的准确参照
考虑只观察一个变量的实验 ,以 为基准。直接相减两个高斯对数密度得到
在基准分布下,,恰好与 LAN 中的 对应。因此可以把 看作高斯位移实验中观测值的局部对应物。这个解释匹配的是局部似然比的极限结构;它本身不是原始全部数据分布与一个高斯分布在总变差距离下等价的断言。
例子与边界
Bernoulli:先把中心序列算出来
令 独立同分布于 Bernoulli,参数 ,基准点取 。记 、。单次观测的对数概率与得分是
在 处,,,于是
中心序列因此为
得分独立同分布且方差为 ,中心极限定理公理库中心极限定理Central limit theorem适当归一化的独立随机变量和在分布上趋于正态分布。给出基准分布下的 。还须控制似然比,才能从这个结论走到 LAN。
展开精确似然比,并控制整个有界区间
令 。充分大的 下所有二元样本在两个模型中都有正概率,所以对数似然比精确等于
为避免把余项藏在形式展开中,先固定 ,令 且 。这样 及其与 之间的所有点都落在 。单次对数概率的二阶、三阶导数为
因为 只能取 或 ,上述区间上 。对每项使用带三阶余项的Taylor 公式公理库泰勒定理Taylor's theorem足够光滑函数由有限阶导数多项式加余项表示。再相加,得到
其中逐项相加的确定性界是
基准分布下 、。由Chebyshev 不等式公理库Chebyshev 不等式Chebyshev's inequality随机变量偏离均值至少给定距离的概率由方差除以距离平方控制。,,其中 表示乘上 后依概率有界。于是把最后两项合成 后,
至此,线性项、信息二次项和余项三项都已核对,且证明了比固定 定义更强的有界区间一致性。对任意固定 ,在基准分布下,
这里及下文在 时把方差为零的正态理解为零点的退化分布。
真参数也随 n 移动时,重新核对概率律
现在固定 ,让数据实际来自 。似然比仍是同一个函数 ,但它的抽样分布已经改变。不能仅把基准分布下的余项收敛和中心极限定理原封不动地搬过来。
先将样本和在真正的均值处中心化:。独立性及 Bernoulli 的特征函数公理库特征函数(概率)Characteristic function of a distribution随机变量的复指数矩,也就是概率分布的 Fourier 变换。给出
对固定的 ,先展开指数,再在 附近取连续的对数分支,有
因 最终留在 ,这些余项常数可与 无关。乘上 后,线性的虚数项被前面的中心化因子消去,故
由特征函数的连续性定理,。同时
再看余项:在当前概率律下,,。所以 ,同一个 Taylor 余项界直接保证 。这一步是在新概率律下重新证明,没有借用尚未建立的换测度定理。代回展开便得到
在下两个均值的符号有明确含义: 衡量备择相对基准的证据,数据来自基准时极限偏负,来自该备择时极限偏正;方差在这两个局部极限中相同。
将两个极限放回高斯实验
定义 。所有系数可以放在同一张表里核对。
| 数据所来自的参数 |
的极限分布 |
的极限分布 |
| 基准 |
|
|
| 局部备择 |
|
|
对应的高斯实验是 ,对数密度比为 。将表中任一行的 分布代入,都恰好得到右栏。因此终点不仅是“样本比例近似正态”,还包括两种数据生成方式下、同一个局部似然比如何变化。
边界点为何不能套用这套计算
若把基准改成 ,样本全为零的概率为一,而任何正的备择参数都会给含有 的样本正概率;备择联合分布不再对基准联合分布绝对连续,上面的似然比前提已经失效。得分中的 也无定义。此处先辨认支持与尺度,比把 机械代入边界更有意义。
即使参数在内点,也不能仅凭对数似然二阶可微就宣布 LAN:仍须证明归一化一阶项的高斯极限、二阶项的正确极限以及局部余项消失。二次均值可微是建立正则 IID 模型 LAN 的一条常用充分条件;其一般定理比这里的 Bernoulli 直接计算更广,本页不以一次形式 Taylor 展开代替它的假设。
推论与应用
LAN 为渐近效率公理库渐近效率Asymptotic efficiency用估计量的渐近协方差相对于正则模型信息下界衡量其局部大样本精度。提供比较不同估计程序的局部模型。Bernoulli 例中 满足
对每个固定 都成立,且极限不随 改变。这既检查了该估计量在局部备择下的正则性,也展示其极限方差 。一般模型中,LAN 本身不保证任意估计量有效;信息下界还需要估计量的局部正则性及相应下界定理。
在Bernstein–von Mises 定理公理库Bernstein–von Mises 定理Bernstein–von Mises theorem · Bayesian asymptotic normality正则有限维模型中后验经局部缩放后趋近以有效估计量为中心的信息正态分布。中,同一展开通过完成平方产生局部后验的候选高斯形状:
最后一项与 无关,被后验归一化吸收;其余部分的中心是 ,方差是 。要把这个局部形状升级为完整的后验近似,还须保证先验在局部足够平坦,并控制该区域以外的后验质量。LAN 解决局部似然结构,后验集中解决质量会不会逃到远处,两项工作各有作用。
参考资料