形式陈述
先陈述实值版本。设 X n 依分布收敛 公理库 依分布收敛 Convergence in distribution · Weak convergence 分布函数在极限分布连续点处收敛的随机变量收敛概念。 到 X ,且 Y n 依概率收敛 公理库 依概率收敛 Convergence in probability 随机变量偏离极限超过任意正阈值的概率趋于零。 到确定常量 c ,记作 Y n → p c 。则
X n + Y n → d X + c , X n Y n → d X c , 并且若 c ≠ 0 ,
X n Y n → d X c . 在 Y n = 0 的事件上,应先给商指定任意有限值(例如零),使每个有限 n 的统计量都有定义。由于 c ≠ 0 且 Y n → P c ,有 P ( Y n = 0 ) ≤ P ( | Y n − c | > | c | / 2 ) → 0 ,这种补充不改变极限分布。
向量情形用联合映射统一表述:若 X n 、Y n 的维数固定,且 g 为 Borel 可测映射,并在 ( X , c ) 处以概率一连续,则
g ( X n , Y n ) → d g ( X , c ) . 这里 X n 与 Y n 无需独立。关键是 Y n 的极限为常量;依概率收敛 公理库 依概率收敛 Convergence in probability 随机变量偏离极限超过任意正阈值的概率趋于零。 足以使联合向量 ( X n , Y n ) 依分布收敛到 ( X , c ) ,再应用连续映射定理 公理库 连续映射定理 Continuous mapping theorem · Mann–Wald theorem 当可测映射的不连续点不承载极限概率时,沿它推前保留弱收敛;阈值映射说明边界质量为何决定成败。 。
直觉
证明骨架
先处理差 Y n − c = o P ( 1 ) ,这里 o P ( 1 ) 表示依概率趋零。对任意有界连续测试函数 f ,X n 的紧性使其高概率落在某个紧集,而 Y n 高概率靠近 c ;f 在相应紧邻域上一致连续,所以
f ( X n , Y n ) − f ( X n , c ) → p 0. 有界性把依概率收敛提升为期望差趋零,而 X n → d X 处理 f ( X n , c ) ,得到联合收敛。和、积、商只是选择具体连续 g 。
这一路径展示了分母条件:g ( x , y ) = x / y 在 y = 0 不连续,只有 c ≠ 0 才可直接应用。
例子与边界
设观测独立同分布、均值为 μ 、方差满足 0 < σ 2 < ∞ 。中心极限定理 公理库 中心极限定理 Central limit theorem 适当归一化的独立随机变量和在分布上趋于正态分布。 给出
n ( X ¯ n − μ ) σ → d N ( 0 , 1 ) , 而样本标准差 S n → p σ > 0 ,则
n ( X ¯ n − μ ) S n = n ( X ¯ n − μ ) / σ S n / σ → d N ( 0 , 1 ) . 这里两个统计量来自同一样本,通常有关联;但 S n / σ 的波动最终缩到常量一,足以完成替换。例如独立 Bernoulli 样本在固定 0 < p < 1 下可用 p ^ ( 1 − p ^ ) 估计 σ = p ( 1 − p ) ,得到常见的样本比例标准化式。若样本全为零或全为一,分母为零,须另定义统计量;这些事件的概率 ( 1 − p ) n + p n 趋零,任意有限赋值均不改变极限,却不能据此宣称小样本区间可靠。
有限样本统计量一般不精确正态,结论只在 n → ∞ 下成立。正态观测下的相应统计量有精确 t 分布,那是额外的有限样本结论。
若 V ^ n → p V > 0 且 n ( θ ^ n − θ 0 ) → d N ( 0 , V ) ,同理得到 studentized 枢轴
n ( θ ^ n − θ 0 ) V ^ n → d N ( 0 , 1 ) . 该替换也可用随机阶记号表达:若 X n = O P ( 1 ) (以高概率保持有界)且 Y n − c = o P ( 1 ) ,则 X n ( Y n − c ) = o P ( 1 ) 。于是 X n Y n = c X n + o P ( 1 ) ,只要 X n 已有分布极限,微小乘法误差不会改变它。这一步仍要求 X n 紧,不能把一个可能爆炸的量与 o P ( 1 ) 相乘后武断地丢掉。
边界与失败情形
若 X n → d X 、Y n → d Y 且两个极限都随机,只知道边缘收敛不足以推出和或积的极限。依赖结构可能随 n 改变;需要联合收敛或额外独立条件。
例如令 X n = Z 。一种构造取 Y n = Z ,另一种取 Y n = − Z ,两者边缘都为同一对称分布,但 X n + Y n 分别为 2 Z 与零。边缘极限完全相同,组合结果不同。
若分母极限为零,商可能发散或出现别的缩放极限。即使 P ( Y n = 0 ) = 0 对每个 n ,也不能绕过 g 在极限点不连续的问题。
独立性既非必要也不能替代常量极限。若 Y n = X n 且两者趋向同一非退化 X ,依赖关系完全已知时可由联合收敛得到 X n Y n → X 2 ;若只知道它们渐近独立,则需明确证明联合极限为乘积分布。
依概率趋于随机变量 Y 时,若同时拥有 ( X n , Y n ) 的联合收敛并且 g 几乎处处连续,连续映射仍可用;不能只引用最简常量版本省略联合条件。
推论与应用
Slutsky 定理是 plug-in 标准误、Wald 统计量 公理库 Wald、Score 与 LR 渐近检验 Wald test · Score test · Lagrange multiplier test 用估计量距离、零点梯度或似然差构造的三类正则大样本检验。 和 nuisance 参数替换的基本接口。它只保证极限分布不变,不提供替换造成的有限样本误差大小。
与Delta 方法 公理库 Delta 方法 Delta method 用可微映射的一阶 Taylor 展开传播估计量的渐近分布与协方差。 结合时,先线性化估计函数,再用 Slutsky 替换未知 Jacobian 或协方差;每个替换量都需一致估计;只有涉及除法或矩阵求逆时,才额外要求极限非零或非奇异。
常用等价表述是:若 X n → d X 且 X n − Z n → p 0 ,则 Z n → d X 。取 Y n = Z n − X n 应用和的结论即可。这允许把复杂统计量替换为已知极限的渐近线性主项,但必须真正证明差在概率意义下消失。
参考资料
John Duchi(授课)、Sky Cao(记录),Stats 300b: Theory of Statistics, Lecture 2 ,Stanford University,讲义首页标注 Winter 2018,第 1 页 Theorem 1。
A. W. van der Vaart, Asymptotic Statistics , Cambridge University Press, 1998,§2.8。
Patrick Billingsley, Convergence of Probability Measures , 2nd ed., Wiley, 1999,Ch. 1。
R. J. Serfling, Approximation Theorems of Mathematical Statistics , Wiley, 1980,§1.5。