Skip to content

定义Definition

估计量的渐近正态性

Asymptotic normality of estimators

估计误差在明确中心、速率与协方差下趋于正态律,以及线性化、标准化和边界失效机制。

形式陈述 ​

在实验序列 {Pθ(n):θ∈Θ} 中,估计量 θ^n∈Rk 若在固定真参数 θ0 下存在确定速率 rn→∞ 与正定矩阵 V(θ0),使

rn(θ^n−θ0)→dNk(0,V(θ0)),

则称其在 θ0 渐近服从多元正态分布。常规独立参数模型常有 rn=n;速率是结论的一部分,不能由“估计量”三个字推出。非参数平滑、支持边界、弱识别与长程依赖都可能改变速率或极限形状。

更一般的中心化允许局部偏移:

n(θ^n−θ0)→dNk(b,V).

因此一项完整声明至少包含真参数、中心、缩放、极限均值与协方差。依分布收敛给出分布层面的弱收敛,既不要求密度逐点接近,也不承诺原始未缩放估计量在有限样本中呈钟形。

由于收敛分布的序列是紧的,rn(θ^n−θ0)=OPθ0(1);再用 rn→∞ 得 θ^n−θ0=oP(1)。所以以上以真值为中心的非退化渐近正态性自动蕴含点态一致性,反向则远远不够。

直觉

渐近正态把有限样本误差云在局部放大:未经缩放时它向真值塌缩,乘上 rn 后若轮廓稳定为椭圆正态,就能用协方差描述不同方向的局部精度。标准误估计的任务,是把这张依赖未知参数的椭圆转换成可由数据计算的近似尺度。

渐近线性骨架 ​

许多估计量满足渐近线性展开

θ^n−θ0=1n∑i=1nψθ0(Xi)+oPθ0(n−1/2),

这里固定维数 k,假设 Xi 独立同分布,Eθ0ψθ0=0,且协方差矩阵 B=Covθ0{ψθ0(X)} 有限。对每个固定 a∈Rk,投影 aTψθ0(Xi) 是均值零、方差 aTBa 的独立同分布实变量。方差为正时应用一元中心极限定理;方差为零时投影几乎必然为零。因此所有这些归一化投影都趋于 N(0,aTBa),再由 Cramér–Wold 定理得到联合极限 Nk(0,B);这里比较的是所有固定线性投影,不只是各坐标边缘。见 Aldous 讲义,Theorems 8.2、8.4。

乘 n 后的 oP(1) 余项再由Slutsky 定理移除。B 可能仅为半正定,此时得到退化多元正态;要符合开头的非退化定义,还须确认 B 正定。函数 ψ 称为影响函数,它把复杂估计量的一阶误差还原成可求和的单观测贡献。

对解估计方程 n−1∑iψ(Xi,θ)=0 的规则,在 θ0 附近 Taylor 展开得到

n(θ^n−θ0)≈−A−11n∑iψ(Xi,θ0),

其中 A=Eθ0[∂θψ(X,θ0)] 必须可逆。若 B=Varθ0{ψ(X,θ0)},极限协方差为

A−1BA−T.

这里隐藏着一致性、局部可微、随机余项一致控制与矩条件;只写一次形式 Taylor 展开不足以证明结论。

例子与边界

在二元结局研究中,独立同分布的 Bernoulli(p) 样本比例 p^=X¯ 对每个固定内部参数 0<p<1 满足

n(p^−p)→dN(0,p(1−p))

用一致的 plug-in 方差 p^(1−p^) 替换未知尺度,得到 studentized 形式

n(p^−p)p^(1−p^)→dN(0,1).

对每个有限 n,全零或全一样本仍会使分母为零;可约定在这些事件上把统计量取为零。固定 0<p<1 时,它们的总概率为 (1−p)n+pn→0,所以该补充定义不改变极限分布,却不能替实际遇到边界样本时的区间程序提供保证。

例如 n=400 次观察中有 100 次成功,p^=0.25,估计标准误为 0.25⋅0.75/400≈0.02165,95% Wald 区间为 0.25±1.96(0.02165)≈[0.2076,0.2924]。极限式中的方差是 p(1−p),实际估计量的近似方差则是 p(1−p)/n;漏掉这个 n 会把局部极限尺度误当成原始误差尺度。

由此产生的 Wald 区间使用正态分位数,覆盖只在相应渐近条件下接近名义水平;它并不等于精确二项区间,罕见事件下的有限样本误差尤其明显。

若科学报告使用 log-odds g(p)=logp/(1−p),内部参数处的一阶变换给渐近方差

g′(p)2p(1−p)=1p(1−p).

同一个分布族在概率与 log-odds 坐标中呈现不同标准误;协方差需要随 Jacobian 变换,裸数字没有脱离目标坐标的含义。

样本中位数展示渐近正态性并不依赖样本均值。若总体分布在唯一中位数 m 附近有连续正密度 f(m)>0,样本中位数 m^ 满足

n(m^−m)→dN(0,14f(m)2).

在污染物浓度等重尾测量中,这给出稳健位置估计的局部尺度;实际标准误还需估计中位数处的密度,而非套用样本均值公式。

边界与失败情形 ​

在 p=0 或 p=1,样本比例恒在边界,方差与 studentized 分母都为零。若 pn=c/n 随 n 移向边界,总成功数趋于 Poisson 律;逐个固定内部 p 的正态定理无法处理这条局部序列。

样本均值的常规结论依赖有限方差;总体尾部重到方差无穷时,n 缩放可能失败并出现稳定分布极限。相关数据还需混合、鞅差或其他依赖条件,长期方差也不再只是单观测方差。

一致性允许许多非正态局部形状。Uniform(0,θ) 的样本最大值 Mn 就是一个可算的例子。对固定 x≥0 及充分大的 n,

P{n(θ−Mn)/θ>x}=P{Mn<θ(1−x/n)}=(1−x/n)n→e−x.

所以一致估计量 Mn 的误差是 1/n 阶,极限是单侧指数分布;|θ^n| 在真值零点的一阶导数不存在,常出现折叠正态而非中心正态。样本中位数若 f(m)=0,上面的 n 结论也会失效。

这个端点例子也检验Bootstrap 的适用范围。经验重采样最大值 Mn∗ 等于原最大值的条件概率为 1−(1−1/n)n→1−e−1,所以 n(Mn−Mn∗)/Mn 在零点始终保留正质量,无法趋于上述连续指数律。如果误用 n,真实与重采样的间隙都退化到零,表面上一致,却没有重现实际 1/n 误差尺度上的不确定性。相反,有限方差均值的条件重采样误差确实趋于同一正态律,但证明需要检验随 n 改变的条件三角阵列,不能只引用原样本的正态极限。

studentization 依赖尺度估计本身一致。对相关或异方差数据仍使用独立同方差公式时,分子可能确有正态极限,分母却收敛到错误常量,所得枢轴自然不会是标准正态。

点态正态极限可能在参数空间上高度不均匀。每个固定内部参数的近似都成立,并不保证距边界 O(n−1/2) 的区域有统一误差控制;若区间要求诚实覆盖,必须研究局部参数序列或建立统一极限定理。

推论与应用

若 V(θ) 可一致估计且不退化,Wald 型标准误与置信区间可由渐近枢轴构造。覆盖误差的数量级还要借助 Berry–Esseen 界、Edgeworth 展开或有针对性的模拟;极限定理只描述 n→∞,不标注某个有限样本何时“足够大”。

光滑重参数化由Delta 方法传播正态极限,Jacobian 奇异时则需更高阶展开。正则似然估计进一步把Fisher 信息的逆与极限协方差相连;模型失配时,A−1BA−T 的 sandwich 形式通常取代单纯的信息逆。

参考资料
  • David Aldous,Sinho Chewi 记录,Probability Theory, Mathematics C218B/Statistics C205B,2017,Theorems 8.2、8.4,pp. 31–32:所有线性投影的 Cramér–Wold 判据与有限协方差的多元 IID 中心极限定理。

  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 2–5。

  • R. J. Serfling, Approximation Theorems of Mathematical Statistics, Wiley, 1980,Ch. 1–2。

  • Thomas S. Ferguson, A Course in Large Sample Theory, Chapman & Hall, 1996,Ch. 2–4。

关系图谱27 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系