形式陈述
在估计规则 公理库 估计量、决策规则与风险 Estimator and decision rule · Statistical risk 从观测到行动的可实施规则,以及在逐参数、Bayes 与最坏情形量词下的期望损失。 框架中,设第 n 个实验为 { P θ ( n ) : θ ∈ Θ } ,估计量 g ^ n 取值于度量空间 ( T , d ) ,目标为 g ( θ ) 。若
P θ ( n ) ( d ( g ^ n , g ( θ ) ) > ε ) ⟶ 0 , 对每个固定 θ ∈ Θ 和每个 ε > 0 成立,则称 g ^ n 对 g 点态弱一致,即在每个参数点依概率收敛 公理库 依概率收敛 Convergence in probability 随机变量偏离极限超过任意正阈值的概率趋于零。 。这里的顺序是先固定 θ ,再让 n 增长。
若不同样本量的观测嵌套在同一概率空间上,并且
P θ ( lim n → ∞ g ^ n = g ( θ ) ) = 1 , 则称点态强一致。强一致蕴含弱一致,反向一般不成立;对三角阵列或随 n 改变的实验,若没有指定共同耦合,几乎必然事件本身便无从比较。
统一弱一致把参数也放进外层最坏情形:对每个 ε > 0 ,要求
sup θ ∈ Θ P θ ( n ) ( d ( g ^ n , g ( θ ) ) > ε ) → 0 , 这比逐点收敛强。若参数序列 θ n 随 n 逼近边界、不可识别点或模型奇异处,点态定理无法自动控制 P θ n ( n ) 下的误差;局部一致性与诚实覆盖常需要直接研究这些移动参数序列。
直觉
一致性只保证估计值最终聚集到正确目标,没有说明聚集速度、极限形状或有限样本风险。把样本量逐渐增大想象成不断收紧的概率云:一致性说任意固定半径之外的质量趋于零,云团内部怎样收缩则留给收敛率和渐近分布回答。
三条常见证明路线
直接路线用概率不等式控制误差。若偏差趋零且方差趋零,Chebyshev 不等式 公理库 Chebyshev 不等式 Chebyshev's inequality 随机变量偏离均值至少给定距离的概率由方差除以距离平方控制。 给出弱一致;这只是便捷的充分条件,一致估计量无需有限方差,也无需在每个 n 无偏。
代入路线先用大数律 公理库 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 证明样本摘要 T n → t ( θ ) ,再由连续映射推出 h ( T n ) → h ( t ( θ ) ) = g ( θ ) 。这条路线同时暴露两个必要检查:h 在极限点连续,且 t ( θ ) 足以识别目标。
极值估计路线令
θ ^ n ∈ argmin θ ∈ Θ M n ( θ ) . 若 M n 在参数空间上一致逼近确定函数 M ,M 在 θ 0 具有分离的唯一极小点,并能控制近似极小解逃向无穷或边界,就可推出 argmin 一致性。仅有每个固定 θ 的逐点收敛,通常不足以交换“取极小”与“取极限”。
例子与边界
若独立同分布的传感器读数满足 E θ | X 1 | < ∞ ,强大数律给出
几 乎 必 然 X ¯ n → μ ( θ ) 几乎必然 , 所以样本均值强一致估计总体平均水平。若进一步有有限方差,
P θ ( | X ¯ n − μ | > ε ) ≤ σ 2 n ε 2 → 0 给出弱一致以及一条显式但可能较松的有限样本上界。第一条结论只需一阶矩,第二条证明更短却用了更强的二阶矩假设。
在 Uniform( 0 , θ ) 端点模型中,M n = max i X i 满足对 0 < ε < θ ,
P θ ( | M n − θ | > ε ) = P θ ( M n < θ − ε ) = ( 1 − ε θ ) n → 0. 它的误差只可能落在端点下方,且尾概率按指数速度消失。M n 在每个有限样本下都有偏,却仍一致;这个例子也预告支持集依赖参数时可能出现 n 而非 n 的误差尺度。
连续 plug-in 保持一致性:θ ^ n → θ 依概率且 h 在 θ 连续时,h ( θ ^ n ) → h ( θ ) 。逆问题还需可识别性 公理库 统计模型的可识别性 Identifiability of a statistical model · Parameter identifiability 观测分布能否唯一决定参数或目标,以及对称、观测机制与弱识别造成的边界。 与局部连续逆;一项对 θ 2 的一致估计在未限制符号时不能恢复 θ 。
边界与失败情形
无偏不蕴含一致。若每个 n 都只保留第一条观测 μ ^ n = X 1 ,其期望始终正确,抽样波动却没有随新增数据缩小,固定误差半径外的概率也不会消失。
一致也不提供有限样本速度。两个规则都可最终靠近真值,却在实际样本规模下差异巨大;集中不等式、风险界或渐近分布才负责量化精度。
模型若把同一数据分布映到两个不同目标值,同一统计量序列不可能在该分布下收敛到两个常数。模型失配时,极值估计量还可能稳定地收敛到准则的伪真参数;“收敛得很稳”本身不能证明科学目标正确。
风险趋零常可由 Markov 不等式推出相应一致性,反向却需要一致可积性或尾部控制。极小概率下的巨大误差可以不妨碍依概率收敛,同时让均方误差上升。
例如令误差 E n = n 的概率为 1 / n 、其余时候为零。任意固定阈值的超越概率都是 1 / n ,故 E n → 0 依概率;然而 E [ E n 2 ] = n 发散。这条轨迹精确展示了尾部质量虽消失、尾部幅度却增长得更快的失败机制。
推论与应用
一致性给出无限数据下的中心定位,是研究渐近正态性 公理库 估计量的渐近正态性 Asymptotic normality of estimators 估计误差在明确中心、速率与协方差下趋于正态律,以及线性化、标准化和边界失效机制。 与渐近置信区间 公理库 置信区间 Confidence interval · Confidence set 由样本决定、在重复抽样下以规定概率覆盖固定参数目标的随机集合。 的常见第一步。无偏、效率、鲁棒性和计算可达性仍是独立性质;某些渐近分布结论会自动蕴含一致性,但证明时依然应明确其参数量词。
审查一项一致性声明时,可以沿四个接口核对:概率由哪个 P θ ( n ) 计算,参数固定还是随 n 移动,结论点态还是统一,目标空间使用哪种距离。缺少其中任何一项,“更多数据会得到真值”都还不是可验证的数学命题。
参考资料
A. W. van der Vaart, Asymptotic Statistics , Cambridge University Press, 1998,Ch. 2 与 5。
Thomas S. Ferguson, A Course in Large Sample Theory , Chapman & Hall, 1996,Ch. 1–2。
R. J. Serfling, Approximation Theorems of Mathematical Statistics , Wiley, 1980,Ch. 1。