形式陈述
设 是可测空间 中的有限观测序列公理库序列Sequence以自然数为定义域的函数。,其中 。经验测度定义为
这里 是集中于 的 Dirac 测度。每次观测贡献 的质量,全部质量为 ,因此 是一个概率分布公理库概率分布Probability distribution · Law可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。。同一个值出现多次时,质量会叠加;经验测度不是对去重后的样本值重新均匀分配。
对实值可测函数 ,有
有限样本上的求和与经验测度积分因而是同一个操作的两种写法。若 是随机观测,把上式中的 换成 ,则 随样本而变;每个可测集合 对应一个随机数 。
定义经验测度不需要独立同分布假设。这一假设将在用经验测度推断总体、或证明收敛时发挥作用。 时不能使用上述归一化公式;空数据需要单独约定处理方式。
直觉
经验测度把一份样本表改写成一个“以观测频率为概率”的分布。用它回答“落在区域 的概率是多少”,得到的就是样本中落在 的比例;用它计算期望,得到的就是样本平均。
这是一种有意的信息保留:它保存各个观测值及重复次数的相对比例,忽略观测顺序;仅凭 也不能恢复样本量,例如 与 给出同一测度。对独立同分布样本,许多统计量正好只依赖这些信息;对时间序列,顺序本身可能携带重要关系,经验测度不能代替完整序列。
它也没有假定总体就是样本中的几个点。即使总体连续,有限样本得到的经验测度仍是离散的;将这个离散对象拿来近似总体是否有效,取决于比较哪些事件或函数,而不取决于两张图看起来是否同样平滑。
例子与边界
用一份样本连起点质量、分布函数与平均值
取样本 。经验测度为
因此 ,,而 。最后一个零只表示样本中没有出现 ,不等于证明总体不可能在其附近取值。
在实数上,经验分布函数为 。上述样本给出
它在样本点处向上跳跃,并且右连续;重复出现的 产生高度 的跳跃。积分取 ,得到 。点质量、阶梯分布函数和样本均值,都是同一个经验分布的不同读法。
样本平均收敛要说明测试对象
若 独立同分布于 ,对于一个预先固定的可测集合 ,强大数定律给出
几乎必然对一个固定的可测函数 ,若 ,则同样有 几乎必然。这里“固定”很重要:不能先用数据挑出最容易出错的集合或函数,再直接引用一个固定对象上的收敛结论。
在实数独立同分布样本上,Glivenko–Cantelli 定理进一步保证
几乎必然这同时控制所有阈值集合 ,比单独固定一个阈值更强,但依然没有控制所有可测集合。一般函数类上的一致收敛需要另行研究该类的复杂度。
离散经验分布为什么仍可能离总体“很远”
设 是实数上的无原子 Borel 概率分布,即每个单点的概率都为零。对任意一份有限样本,令 ,则
因此按 的约定,总变差距离始终等于 ,即使经验分布函数已经一致逼近总体分布函数。这并不矛盾:总变差允许从所有可测集合中选择最能区分两者的集合,包括依赖这份样本的有限集合 。
所以“经验测度趋于总体”必须带上具体的收敛方式。对实数独立同分布样本,可以获得弱收敛;对可积固定函数可以获得相应积分收敛;全体可测事件上的统一近似则是另一项更强的要求。
推论与应用
插件估计与自助法
给定分布泛函 ,插件估计用 替代未知的 。均值给出样本均值,分位数给出经验分位数;是否一致、误差如何,仍需要结合泛函的性质和样本假设,不能仅从替换记号推出。
普通非参数 bootstrap 在给定原样本之后,独立地从 中有放回抽样,再计算统计量。这解释了为什么重复值必须保留正确质量:从四个样本位置均匀抽取时,上例抽到值 的概率是 ,不是对三个不同值均匀抽取的 。对有时间依赖的数据,简单重抽单点通常不保留依赖结构,需要不同的重采样设计。
平滑、加权与在线更新
直方图把样本先分箱,核密度估计把每个点质量替换成一个小核;它们是对经验测度做进一步处理,不是经验测度的另一种原封不动的表达。选择箱宽或带宽引入了新的建模与误差问题。
若非负权重满足 ,则 是加权经验概率测度;普通经验测度是 的情形。等权样本增加一个观测时有
从而均值等线性统计量可以在线更新。这个恒等式没有宣称有限大小的摘要一定能保存经验测度的全部信息;保存所有不同样本值仍可能需要随样本量增长的空间。
参考资料
- Larry Wasserman,CMU 36-705,Lecture Notes 7:经验分布函数与一致收敛;Lecture Notes 8:从固定事件推广到集合类。
- Larry Wasserman,All of Statistics,作者页面,第 7–8 章:经验分布、插件原则与 bootstrap。
- A. W. van der Vaart、J. A. Wellner,Weak Convergence and Empirical Processes:经验测度的函数类观点及收敛方式之间的区别。