形式陈述
设 X 1 , X 2 , … 为同一概率空间上的IID 样本 理路 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 ,共同分布为固定的 P 。参数集 Θ ⊂ R p 非空且紧,维数 p 固定。写 P n f = n − 1 ∑ i = 1 n f ( X i ) ,P f = E P f ( X ) 。本页给出一个容易检验的充分条件,不试图覆盖所有一致大数律。
假设 m ( x , θ ) 联合可测,并且存在非负可积随机函数 L ( X ) ,使在同一个 P -零测集之外,对所有 θ , ϑ ∈ Θ 都有
| m ( X , θ ) − m ( X , ϑ ) | ≤ L ( X ) ‖ θ − ϑ ‖ . 再要求至少有一个 θ ∗ ∈ Θ 满足 E | m ( X , θ ∗ ) | < ∞ 。则
sup θ ∈ Θ | P n m θ − P m θ | → a . s . 0. “几乎必然”采用整条嵌套样本路径 理路 几乎必然收敛 Almost sure convergence 除去一个零概率事件后,随机变量序列逐样本收敛。 的含义。随机 Lipschitz 界与 Θ 有界还保证所有 m θ 可积。参数连续性使上确界可在一个固定可数稠密子集上求取,故其可测性也得到解决。
有限网证明
固定 δ > 0 。由紧性 理路 紧空间 Compact space 每个开覆盖都能缩减为有限子覆盖的拓扑空间。 ,可选有限点 θ 1 , … , θ N ,使每个 θ 距某个 θ j 不超过 δ 。对这样的 j ,
| ( P n − P ) m θ | ≤ | ( P n − P ) m θ j | + δ ( P n L + P L ) . 第一项控制网点,后两项分别控制经验平均和总体平均在网点附近的变化。因此
sup θ | ( P n − P ) m θ | ≤ max 1 ≤ j ≤ N | ( P n − P ) m θ j | + δ ( P n L + P L ) . 对有限个可积网点函数及 L 应用强大数律 理路 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 。在概率一的事件上,右侧的极限上界为 2 δ P L 。依次取 δ = 1 , 1 / 2 , 1 / 3 , … ,所有网点仍只有可数个,故这些概率一事件的交仍有概率一;在交事件上再令 δ ↓ 0 ,结论成立。
证明的次序很重要:先固定网的精度,让样本量增长,再把网加密。若直接令网点数量随 n 增大,仅说“每个网点满足大数律”,不能控制越来越多的最大误差。
直觉
参数集虽有无限多个点,但相邻参数产生的观测损失差被同一个可积尺度约束。有限网先为少数代表点取得同时收敛;Lipschitz 界再把代表点的保证传给附近所有点。随机的 L ( X ) 可以很大,只要平均后稳定,不必要求损失处处有界。
本定理对参数 θ 一致,但分布 P 从头到尾固定。它没有提供同时适用于所有分布的样本复杂度,也没有给指数尾概率。经验风险的一致收敛 理路 经验风险的一致收敛 Uniform convergence of empirical risks 以高概率同时控制整个假设类的经验风险与总体风险偏差。 中的分布一致高概率保证有更强的外层量词;不能因为两页都出现上确界,就把其结论视为同一强度。
例子与边界
平方损失需要的包络
取 Θ = [ − R , R ] ,m θ ( x ) = ( x − θ ) 2 。由因式分解,
| m θ ( x ) − m ϑ ( x ) | = | θ − ϑ | | 2 x − θ − ϑ | ≤ ( 2 | x | + 2 R ) | θ − ϑ | . 若 E X 2 < ∞ ,则 m 0 = X 2 可积,L ( X ) = 2 | X | + 2 R 也可积,故全区间上一致收敛。这里只验证一个锚点函数及一个 Lipschitz 包络,避免为每个参数分别重复矩条件。
取 R = 2 ,某次样本中 P n | X | = 3 ,已知 E | X | ≤ 4 。则 P n L ≤ 10 、P L ≤ 12 。如果使用半径 δ = 0.001 的有限网,且每个网点误差至多0.008,整区间误差就至多 0.008 + 0.001 ( 10 + 12 ) = 0.030 。这展示如何读取有限网不等式;“所有网点误差至多0.008”仍需要自己的数据或概率证据。
Huber 准则可以先中心化
固定阈值 c > 0 ,令 ρ c 为Huber 损失 理路 M-估计 M-estimation · M-estimator 通过随机准则的精确或近似极值选择参数,并把样本准则与总体识别目标分开。 。由于其斜率绝对值不超过 c ,中心化损失
m θ ( x ) = ρ c ( x − θ ) − ρ c ( x ) 满足 | m θ ( x ) − m ϑ ( x ) | ≤ c | θ − ϑ | ,且 m 0 = 0 。所以在任意固定紧区间上,即使 E | X | = ∞ ,该中心化准则也满足本定理。减去与参数无关的项不改变样本 argmin,却使总体期望存在。这项处理不能照搬到平方损失:平方损失差仍含 X ,通常至少需要一阶矩。
参数空间扩大时不能照搬
对平方损失在整个 R 上,
P n m θ − P m θ = ( P n X 2 − E X 2 ) − 2 θ ( X ¯ − E X ) . 只要 X ¯ ≠ E X ,右侧绝对值对 θ 的上确界就是无穷。样本均值仍可一致,但不能通过“全实轴上平方准则一致收敛”证明。正确方法是先定位到高概率有界区域,或者利用均值的显式公式。
参数维数随 n 增长时,固定有限网的证明也失去原来的次序。需要跟踪覆盖数、包络和网点偏差随 n 的变化;这已是定量经验过程问题,而非本定理的自动推论。
推论与应用
把 m θ 作为随机准则后,本结论提供Argmin 一致性定理 理路 Argmin 一致性定理 Argmin consistency theorem 用总体分离、随机一致逼近和近似求解容差,把样本准则的极小点定位到总体目标。 所需的一致逼近。把它逐分量用于得分的导数或得分外积,还可建立sandwich 插件协方差 理路 Sandwich 协方差估计 Sandwich covariance estimation 从得分与敏感度的样本矩阵算出可复核的协方差、对比标准误和异方差稳健推断。 的局部一致性;矩条件必须针对这些新函数重新核验,不能由原损失可积直接推断二阶得分可积。
自测与答案
若 m θ ( x ) = | x − θ | 且 E | X | = ∞ ,能否直接用本定理?答案:原损失的可积锚点条件失败。改用 | x − θ | − | x | 后,锚点为零、L = 1 ,在紧区间上可以。
若每一对参数各有一个例外零测集,为何还要求同一个零测集?答案:不可数多个零测集的并不一定为零。证明需要在同一观测上同时控制全部参数,逐对几乎处处的陈述未必提供这一点。
参考资料