形式陈述
给定可测空间 ( Z , A ) 中的有限观测序列 公理库 序列 Sequence 以自然数为定义域的函数。 s = ( z 1 , … , z m ) ,其经验测度定义为
D ^ s = 1 m ∑ i = 1 m δ z i , 其中 δ z ( A ) = 1 { z ∈ A } 是点 z 处的 Dirac 概率测度 公理库 测度 Measure 在 σ-代数上取非负扩展实值并满足可数可加性的函数。 。于是 D ^ s 是概率分布 公理库 概率分布 Probability distribution · Law 定义在可测空间上的概率测度;随机变量的律是由推前得到的一类分布。 ,并且对任意 D ^ s -可积函数 f ,
∫ f d D ^ s = 1 m ∑ i = 1 m f ( z i ) . 经验测度的定义不要求样本独立、同分布甚至随机;它只把一份有限数据编码成概率测度。若 S = ( Z 1 , … , Z m ) 是随机样本,则 D ^ S 才成为随机测度。
直觉
经验测度把每次观测分配质量 1 / m 。相同值重复出现时,质量自动累加,因此它保留频数而忽略抽取次序。对经验测度积分就是做样本平均,这把“数据表上的计算”翻译成“分布上的积分”。
它不是未知总体分布的另一个名字。经验测度只把质量放在已观测点上;总体可能连续、具有未见原子或拥有复杂依赖。它能否逼近总体取决于采样协议、所用距离和测试函数类。
例子与边界
若 s = ( a , a , b ) ,则
D ^ s = 2 3 δ a + 1 3 δ b . 集合 { a , b } 若被错误地均匀化会给两点各 1 / 2 质量,丢掉重复信息。若 f ( a ) = 0 , f ( b ) = 3 ,经验积分为 1 。
实值样本对应的经验分布函数为
F ^ m ( x ) = D ^ s ( ( − ∞ , x ] ) = 1 m ∑ i = 1 m 1 { z i ≤ x } . 这是经验测度在半无限区间上的取值,不应与核密度估计混同;后者把原子进一步平滑。
即使 Z i IID 来自连续分布 D ,D ^ S 与 D 的总变差距离通常恒为最大值,因为前者离散、后者无原子。另一方面,对固定有界连续函数积分可以收敛。因此“经验分布收敛”必须说明拓扑或函数类,不能只写一个无类型距离。
推论与应用
在IID 样本 公理库 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 下,大数律 公理库 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 对每个固定可积 f 给出
∫ f d D ^ S ⟶ ∫ f d D . 若要对整个函数类同时控制,需要经验过程、VC 维或 Rademacher 复杂度等额外结构。固定函数收敛不自动推出对所有可测集合的一致收敛。
经验风险、bootstrap、经验分布函数与非参数估计都可从本对象出发:经验风险是损失函数的经验积分,非参数 bootstrap 从 D ^ S 再抽样,核密度估计则将其与核卷积。每种应用都加入新的统计假设,经验测度本身不提供泛化保证。
参考资料
A. W. van der Vaart and Jon A. Wellner, Weak Convergence and Empirical Processes , Springer, 1996, Chapter 2.
A. W. van der Vaart, Asymptotic Statistics , Cambridge University Press, 1998, Chapter 19.
Patrick Billingsley, Convergence of Probability Measures , 2nd ed., Wiley, 1999.