形式陈述
设 是可测空间 中的有限观测序列公理库序列Sequence以自然数为定义域的函数。,其中 。经验测度定义为
这里 是集中于 的 Dirac 测度。每次观测贡献 的质量,全部质量为 ,因此 是一个概率分布公理库概率分布Probability distribution · Law可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。。同一个值出现多次时,质量按出现次数叠加。
对实值可测函数 ,有
有限样本上的求和与经验测度积分因而是同一个操作的两种写法。若 是随机观测,把上式中的 换成 ,则 随样本而变;每个可测集合 对应一个随机数 。
这个定义适用于任意非空有限观测序列。独立同分布等采样假设用于进一步建立经验测度与总体分布之间的联系。
直觉
经验测度把一份样本表改写成一个“以观测频率为概率”的分布。用它回答“落在区域 的概率是多少”,得到的就是样本中落在 的比例;用它计算期望,得到的就是样本平均。
这是一种有意的信息保留:它保存每个可测集合中的观测频率,忽略观测顺序。在实数空间等单点可测的值域中,这也就保留了各个观测值及重复次数的相对比例;一般可测空间却未必能区分两个不同的点。仅凭 也不能恢复样本量,例如 与 给出同一测度。对独立同分布样本,许多统计量正好只依赖这些信息;对时间序列,顺序本身可能携带重要关系,经验测度不能代替完整序列。
总体即使连续,有限样本的经验测度也由有限个点质量组成。比较事件概率或函数积分,就能分析这个离散分布在何种意义下逼近总体;下面的分布函数与总变差例子展示了两种不同尺度。
例子与边界
用一份样本连起点质量、分布函数与平均值
取样本 。经验测度为
因此 ,,而 。这里的零记录了观测频数;附近区间的经验概率则由落入区间的样本点共同决定。
在实数上,经验分布函数为 。上述样本给出
它在样本点处向上跳跃,并且右连续;重复出现的 产生高度 的跳跃。积分取 ,得到 。点质量、阶梯分布函数和样本均值,都是同一个经验分布的不同读法。
样本平均收敛要说明测试对象
若 独立同分布于 ,对于一个预先固定的可测集合 ,强大数定律公理库强大数定律Law of large numbers · Strong law of large numbers · SLLN独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。给出
几乎必然对一个固定的可测函数 ,若 ,则同样有 几乎必然。这些结论各自针对同一个测试对象随样本量增长的表现。若测试对象也由样本选择,则可用整个候选类上的一致界来控制它。
在实数独立同分布样本上,Glivenko–Cantelli 定理进一步保证
几乎必然这同时控制所有阈值集合 。将阈值类换成更一般的集合类或函数类时,一致收敛取决于该类的复杂度。
DKW 不等式公理库Dvoretzky–Kiefer–Wolfowitz 不等式Dvoretzky-Kiefer-Wolfowitz inequality · DKW inequality · DKW-Massart inequality经验分布函数在全部实数阈值上的最大误差具有统一有限样本指数界,可直接形成整条分布函数的置信带。进一步给出最大 CDF 误差的有限样本指数界,能把渐近的一致收敛升级为指定错误概率的整曲线置信带;该界允许总体有原子,但仍要求独立同分布抽样。
离散经验分布为什么仍可能离总体“很远”
设 是实数上的无原子 Borel 概率分布,即每个单点的概率都为零。对任意一份有限样本,令 ,则
因此按 的约定,总变差距离始终等于 ,即使经验分布函数已经一致逼近总体分布函数。这并不矛盾:总变差允许从所有可测集合中选择最能区分两者的集合,包括依赖这份样本的有限集合 。
因此,对实数独立同分布样本,经验测度可弱收敛到总体,对每个可积的固定函数也有积分收敛;总变差则同时比较所有可测事件,采用了更强的距离。
推论与应用
插件估计与自助法
给定分布泛函 ,插件估计用 估计 。均值泛函给出样本均值,分位数泛函给出经验分位数。若 在某种收敛方式下趋于 ,且 对这种收敛在 处连续,就能把测度的收敛传给统计量。
普通非参数Bootstrap公理库BootstrapBootstrap resampling · Nonparametric bootstrap用条件重采样律近似抽样误差:完整计算均值的有限分布,证明有限方差下一致性,并由最大值的持久原子判定失败。 在给定原样本之后,独立地从 中有放回抽样,再计算统计量。这解释了为什么重复值必须保留正确质量:从四个样本位置均匀抽取时,上例抽到值 的概率是 ,不是对三个不同值均匀抽取的 。对有时间依赖的数据,简单重抽单点通常不保留依赖结构,需要不同的重采样设计。
经验测度的一阶、二阶积分还说明均值重采样的精确尺度。写 ,从 独立抽 次所得均值满足
对上面的样本 ,有 、,所以重采样均值的条件方差为 。这是对给定经验分布的精确计算。
支持端点展示了另一种重采样行为。若原样本最大值只出现一次,从 重抽 次时,至少抽到它一次的概率为 。因此重采样最大值以不消失的概率恰等于原最大值;Bootstrap 的极限分布分析需要处理这个原子,而均值的平均化机制给出另一条收敛路线。
平滑、加权与在线更新
直方图先按区间合并点质量,核密度估计则把每个点质量摊成一个小核。箱宽或带宽决定局部平均的尺度:范围越大,估计越平滑,保留的细节越少。
若非负权重满足 ,则 是加权经验概率测度;普通经验测度是 的情形。等权样本增加一个观测时有
从而均值等线性统计量可以在线更新。
IID 假设不仅给经验积分的大数定律,也能刻画整份经验测度出现异常的指数成本。Sanov 定理公理库Sanov 定理Sanov theorem以相对熵刻画 IID 经验测度偏离总体分布的指数成本,有限字母表下可由类型计数推导。在弱拓扑下以相对熵为速率,有限字母表时可以从频率表的排列数与单个排列概率直接推导。
参考资料
- Larry Wasserman,CMU 36-705,Lecture Notes 7:经验分布函数与一致收敛;Lecture Notes 8:从固定事件推广到集合类。
- Larry Wasserman,All of Statistics,作者页面,第 7–8 章:经验分布、插件原则与 bootstrap。
- A. W. van der Vaart、J. A. Wellner,Weak Convergence and Empirical Processes:经验测度的函数类观点及收敛方式之间的区别。