形式陈述
设 独立同分布于有限维参数模型 , 是参数空间内点。若估计量具有渐近正态性理路估计量的渐近正态性Asymptotic normality of estimators估计误差在明确中心、速率与协方差下趋于正态律,以及线性化、标准化和边界失效机制。
且单样本Fisher 信息理路Score 与 Fisher 信息Score function · Fisher information对数似然的局部参数导数、其模型内二次平均,以及零均值和曲率等式成立的正则条件。 非奇异,统计实验满足局部渐近正态(LAN)条件理路局部渐近正态性Local asymptotic normality · LAN在根号 n 局部尺度上把对数似然比展开为高斯随机线性项与信息二次项,并完整计算 Bernoulli 模型的两种局部极限。、估计量在局部扰动下正则,则其极限协方差满足信息下界
这里正则性要求:对每个固定 ,在 下, 的极限分布不随 改变;只验证固定 下渐近正态并不足够。LAN 条目中的 Bernoulli 计算把这两个义务分开完成:先证明模型的局部似然展开,再证明样本比例在移动真参数下仍有同一个中心化极限。记号 表示对每个向量 ,都有 。
若等号成立,称 在 渐近有效。标量参数下,两个渐近正态估计量 的相对效率常定义为
约定需明确谁在分子;数值大于一表示 具有较小渐近方差。
向量情形协方差矩阵只有偏序,可能一个估计量在某些方向更好、另一些方向更差。若要压成标量,应指定迹、行列式或目标函数 Jacobian 所诱导的损失。
例子与边界
设 独立同分布于 , 已知。样本均值满足
而信息逆为 ,所以 有效。
对同一位置模型,取 ;正态密度在中位数 附近连续且为正,因而可对 应用样本分位数渐近公式理路样本分位数的渐近线性化Sample quantile asymptotics · Bahadur representation for a sample quantile在目标分位附近密度连续且为正时,经验分位的随机逆可线性化,余项由局部经验分布振荡控制。,得到样本中位数的渐近方差
因此中位数相对均值的效率为
按首阶方差,要获得与均值相近的精度,中位数约需 倍样本。但在污染或重尾分布下,中位数的稳健性可能更重要;效率数值必须连同模型说明。
Hodges 规则:先建立精确风险恒等式
令 独立同分布于 ,记样本均值为 ,定义
阈值比均值的典型噪声尺度 大,却仍趋于零。若真实均值为零,大多数样本会落入阈值;若真实均值固定且非零,阈值最终与它分离。这个规则完全由数据决定,没有使用未知参数。
为同时处理固定与移动参数,写
这里的正态分布是每个 的精确分布。阈值事件内外的缩放误差分别为 和 ,因而有精确恒等式
其中 是均方风险。事件互斥,所以平方后没有交叉项。风险计算将始终从这条式子出发;误差依分布收敛本身并不保证其二阶矩收敛。
记 ,。利用 分部积分,对 得到
同时,,对 使用Markov 不等式理路Markov 不等式Markov's inequality非负随机变量超过阈值的概率由其期望除以阈值控制。可得 ;对 同理,所以 。这两个显式尾界足够处理以下所有二阶矩。
固定参数点:零点的超效率与其他点的通常极限
在 时,,故
事实上,对任意确定的正数序列 和任意 ,。因此无论选择多快的确定缩放, 都依概率趋于零;这句话谈的是概率收敛,不能改写成任意速度的矩收敛。根号 缩放的极限是零点的点质量,并非具有正方差的正态分布。
若固定 ,充分大的 下 。由三角不等式,,所以 ,进而 。风险也回到均值的基准,但需要单独证明。由精确恒等式及 ,
最后一步用到固定非零 下 ,指数衰减压过前面的 。所以该规则在每个固定非零点都有通常极限,而零点却表现得特别好;仅看这些逐点结论,还看不到它的不正则性。
根号 n 局部参数:中心化极限随方向变化
现在让真参数为 ,其中 固定。此时 , 给出 。缩放误差在高概率事件上精确等于 ,所以
中心化后的极限依赖 ,违反零点处正则性的量词。相比之下,样本均值对每个 都有 。模型本身的正态结构并没有使阈值估计规则变得正则。
取 ,有 。于是
局部缩放风险因此趋于 ;只要 ,它就超过样本均值对所有参数均成立的精确缩放风险 。以下表格把固定点和移动参数放在同一个中心化标准下比较。
| 参数序列 |
的极限 |
的极限 |
| 固定 |
零点的点质量 |
|
| 固定 |
|
|
| ,固定 |
处的点质量 |
|
更大的收缩邻域:最坏风险比发散
上面的固定 证明了不正则,但还没有证明一个邻域内的缩放风险随 发散。为此取阈值内部的参数 ,于是 。事件 包含于 ,所以
反向也可控制:,故精确恒等式给出
两界夹逼得到 。与样本均值的 相比,风险比渐近为 。特别是
这仍是一个缩向零的邻域,却比 尺度大。两个尺度回答不同问题:固定 揭示中心化极限为何不正则, 邻域则定量揭示阈值抹去信号所造成的风险损失。不能把点态极限先取完,再当作对这些移动参数一致成立的结论。
与有限样本界的区别
Cramér–Rao 下界理路Cramér–Rao 下界Cramér–Rao lower bound · Information inequality正则可微模型中由 score 协方差恒等式推出的方差与 MSE 下界、等号条件及非正则边界。针对正则、通常无偏的有限样本估计量;渐近效率允许 偏差,只要求首阶局部展开达到信息逆。MLE 常渐近有效,却未必有限样本无偏或逐样本达到 Cramér–Rao 等号。
进一步假定估计量有影响函数展开
令 为单观测得分。在通常可交换微分与积分的条件下,正则影响函数满足 、。写成
即可得到 。这给出信息界的直接证明,也说明等号何时成立:多出的正交噪声 必须几乎处处为零。
边界与失败情形
模型失配时得分方差与负 Hessian 的期望不同,信息逆不再等于夹心协方差;仍称“达到 Fisher 界”会比较错对象。
边界、不可识别、半参数干扰项或非 速率问题需要切空间与有效信息等推广。奇异信息矩阵不能直接求逆。
渐近方差相同不代表方法同样好。高阶偏差、异常值敏感性和优化失败可主导实际样本。
样本量换算只是首阶解释:若方差近似 ,渐近方差比对应达到同一标准误所需的样本比。固定样本下的偏差、离散性和优化失败不会被 ARE 捕获,所以 不能解释成所有样本量上的精确性能百分比。
效率依赖模型和目标方向。光滑一一重参数化下,非零 Jacobian 会同时缩放两个标量方差,相对效率保持;导数退化或向量目标降维时必须重算。用行列式压缩向量协方差,还可能掩盖科学上关键方向的损失。