Skip to content

定理Theorem

参数化一致大数律

Parametric uniform law of large numbers

用紧参数集和可积随机 Lipschitz 界,把逐点大数律提升为同一样本上的全参数控制。

形式陈述 ​

设 X1,X2,… 为同一概率空间上的IID 样本,共同分布为固定的 P。参数集 Θ⊂Rp 非空且紧,维数 p 固定。写 Pnf=n−1∑i=1nf(Xi),Pf=EPf(X)。本页给出一个容易检验的充分条件,不试图覆盖所有一致大数律。

假设 m(x,θ) 联合可测,并且存在非负可积随机函数 L(X),使在同一个 P-零测集之外,对所有 θ,ϑ∈Θ 都有

|m(X,θ)−m(X,ϑ)|≤L(X)‖θ−ϑ‖.

再要求至少有一个 θ∗∈Θ 满足 E|m(X,θ∗)|<∞。则

supθ∈Θ|Pnmθ−Pmθ|→a.s.0.

“几乎必然”采用整条嵌套样本路径的含义。随机 Lipschitz 界与 Θ 有界还保证所有 mθ 可积。参数连续性使上确界可在一个固定可数稠密子集上求取,故其可测性也得到解决。

有限网证明 ​

固定 δ>0。由紧性,可选有限点 θ1,…,θN,使每个 θ 距某个 θj 不超过 δ。对这样的 j,

|(Pn−P)mθ|≤|(Pn−P)mθj|+δ(PnL+PL).

第一项控制网点,后两项分别控制经验平均和总体平均在网点附近的变化。因此

supθ|(Pn−P)mθ|≤max1≤j≤N|(Pn−P)mθj|+δ(PnL+PL).

对有限个可积网点函数及 L 应用强大数律。在概率一的事件上,右侧的极限上界为 2δPL。依次取 δ=1,1/2,1/3,…,所有网点仍只有可数个,故这些概率一事件的交仍有概率一;在交事件上再令 δ↓0,结论成立。

证明的次序很重要:先固定网的精度,让样本量增长,再把网加密。若直接令网点数量随 n 增大,仅说“每个网点满足大数律”,不能控制越来越多的最大误差。

直觉

参数集虽有无限多个点,但相邻参数产生的观测损失差被同一个可积尺度约束。有限网先为少数代表点取得同时收敛;Lipschitz 界再把代表点的保证传给附近所有点。随机的 L(X) 可以很大,只要平均后稳定,不必要求损失处处有界。

uniform 对哪个对象 ​

本定理对参数 θ 一致,但分布 P 从头到尾固定。它没有提供同时适用于所有分布的样本复杂度,也没有给指数尾概率。经验风险的一致收敛中的分布一致高概率保证有更强的外层量词;不能因为两页都出现上确界,就把其结论视为同一强度。

例子与边界

平方损失需要的包络 ​

取 Θ=[−R,R],mθ(x)=(x−θ)2。由因式分解,

|mθ(x)−mϑ(x)|=|θ−ϑ||2x−θ−ϑ|≤(2|x|+2R)|θ−ϑ|.

若 EX2<∞,则 m0=X2 可积,L(X)=2|X|+2R 也可积,故全区间上一致收敛。这里只验证一个锚点函数及一个 Lipschitz 包络,避免为每个参数分别重复矩条件。

取 R=2,某次样本中 Pn|X|=3,已知 E|X|≤4。则 PnL≤10、PL≤12。如果使用半径 δ=0.001 的有限网,且每个网点误差至多0.008,整区间误差就至多 0.008+0.001(10+12)=0.030。这展示如何读取有限网不等式;“所有网点误差至多0.008”仍需要自己的数据或概率证据。

Huber 准则可以先中心化 ​

固定阈值 c>0,令 ρc 为Huber 损失。由于其斜率绝对值不超过 c,中心化损失

mθ(x)=ρc(x−θ)−ρc(x)

满足 |mθ(x)−mϑ(x)|≤c|θ−ϑ|,且 m0=0。所以在任意固定紧区间上,即使 E|X|=∞,该中心化准则也满足本定理。减去与参数无关的项不改变样本 argmin,却使总体期望存在。这项处理不能照搬到平方损失:平方损失差仍含 X,通常至少需要一阶矩。

参数空间扩大时不能照搬 ​

对平方损失在整个 R 上,

Pnmθ−Pmθ=(PnX2−EX2)−2θ(X¯−EX).

只要 X¯≠EX,右侧绝对值对 θ 的上确界就是无穷。样本均值仍可一致,但不能通过“全实轴上平方准则一致收敛”证明。正确方法是先定位到高概率有界区域,或者利用均值的显式公式。

参数维数随 n 增长时,固定有限网的证明也失去原来的次序。需要跟踪覆盖数、包络和网点偏差随 n 的变化;这已是定量经验过程问题,而非本定理的自动推论。

推论与应用

把 mθ 作为随机准则后,本结论提供Argmin 一致性定理所需的一致逼近。把它逐分量用于得分的导数或得分外积,还可建立sandwich 插件协方差的局部一致性;矩条件必须针对这些新函数重新核验,不能由原损失可积直接推断二阶得分可积。

自测与答案 ​

  1. 若 mθ(x)=|x−θ| 且 E|X|=∞,能否直接用本定理?答案:原损失的可积锚点条件失败。改用 |x−θ|−|x| 后,锚点为零、L=1,在紧区间上可以。
  2. 若每一对参数各有一个例外零测集,为何还要求同一个零测集?答案:不可数多个零测集的并不一定为零。证明需要在同一观测上同时控制全部参数,逐对几乎处处的陈述未必提供这一点。
参考资料
  • Peter Bartlett,Theoretical Statistics, Lecture 8,2013:一致大数律及 Glivenko–Cantelli 类的统计用途。本页的紧参数 Lipschitz 版本由上面的有限网论证完整证明。
  • Whitney K. Newey 与 Daniel McFadden,Large Sample Estimation and Hypothesis Testing,1994,§2.3、Lemma 2.4,印刷第2129页(PDF第19页):紧参数、逐参数几乎处处连续与可积包络的更一般弱一致大数律;其脚注17提醒上确界可测性。本页以更强的共同 Lipschitz 条件自证强收敛,并单独处理可测性。
关系图谱20 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

使用的工具

被这些条目使用