形式陈述
设 是可测空间, 是其上的概率分布。独立同分布样本公理库独立同分布样本IID sample · Independent and identically distributed sample以乘积分布描述来自同一总体的独立重复观测。描述数据的随机生成协议:
其中各 相互独立且都服从 。 是随机向量;实验完成后得到的
才是一份具体数据。概率、期望和高概率保证通常对随机样本 取量词,而算法在输入实现值 后进行确定性或条件随机计算。
经验测度公理库经验测度Empirical measure · Empirical distribution把有限观测的重复频数编码为原子概率测度。把这份有限数据编码为
对任意可积函数 ,有
因此,经验测度把样本平均改写成对一个原子概率测度的积分。若输入仍写成随机样本 ,则 是随机测度;条件于 后,它又是普通的确定性概率测度。
IID 与经验测度属于不同层次。IID 是联合分布假设,经验测度是对任意有限序列都可执行的数据变换。依赖数据、时间序列或人为选取的点同样拥有经验测度,却不服从 ;反过来,研究 IID 样本的完整似然、顺序统计量或坐标事件时,也未必需要先把数据压缩成经验测度。
直觉
可以把统计流程分成四层:总体机制 产生随机样本 ,随机样本实现为数据 ,数据再映射为经验测度 。前两步属于概率模型,最后一步属于表示选择。把四层混成“样本分布”,很容易不清楚某个等式究竟是定义、随机变量恒等式还是渐近结论。
经验测度为每次观测分配质量 。重复值的质量会累加,抽取顺序则被忽略。因此它比集合保留更多信息,又比有序元组保留更少信息。对于经验风险、样本均值等置换不变统计量,这种压缩恰到好处;对于时间顺序、依赖结构或序列似然,它会丢掉关键内容。
IID 假设的作用不是让经验测度“成为概率分布”——它无论如何都是概率测度。IID 提供的是关于 如何围绕总体 波动的概率规律。大数律、集中不等式和经验过程理论都建立在这一区别上。
例子与边界
若 ,则
把数据误写成集合 并均匀赋权,会把两个点都置为质量 ,从而删除重复次数。若 ,真实经验平均为 ,而去重后的平均为 。这里不是“换一组数字”的装饰性算例,而是在展示集合、多重集和经验测度承载的信息确实不同。
二分类中令 ,并对分类器 取损失
总体错误率是 ,经验错误率是 。泛化间隙公理库经验风险与泛化间隙Empirical risk · Generalization gap训练平均损失与总体风险之差,以及数据依赖选择带来的困难。正是这两个积分之差。这里 IID 决定如何对训练集随机性做概率控制,经验测度则负责把训练损失写成统一的积分对象。
有限总体不放回抽样通常带有负相关;时间序列含有自相关;在线学习和 bandit 中第 个观测依赖此前动作。这些数据仍能形成经验测度,却不能直接使用 下的 IID 集中结论。相应分析需要有限总体修正、混合条件、鞅工具或自适应数据理论。
经验测度也不在所有距离下逼近总体。若 连续,而 只支持在有限个点上,两者的总变差距离通常保持最大;但对固定有界连续函数,经验积分可以收敛。声称“经验分布趋近真实分布”时,必须说明采用弱收敛、Wasserstein 距离、某个函数类上的一致偏差,还是其他具体拓扑。
推论与应用
对固定可积函数 ,大数律公理库强大数定律Law of large numbers · Strong law of large numbers · SLLN独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。在适当条件下给出
固定函数的收敛只控制一个随机量。学习理论需要同时控制一整个损失函数类,因而还要引入 VC 维、Rademacher 复杂度、覆盖数或稳定性。样本量增大并不会自动消除模型类选择带来的适应性。
Bootstrap 从经验测度 再抽样,以数据驱动方式近似统计量的抽样分布;核密度估计把经验原子与核卷积,得到平滑估计;经验风险最小化则在候选函数之间比较经验积分。三者都从同一个数据摘要出发,却加入了不同的算法与统计假设。
拆开生成协议和经验对象还有一个直接好处:推广到非 IID 数据时,只需替换随机样本模型,经验测度的定义无需改变;改用加权经验测度、在线平均或依赖结构摘要时,也不必把总体分布假设一并重写。关系清楚之后,哪些结论来自采样,哪些只是代数恒等式,便能逐项检查。
参考资料
- A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998, Chapters 2 and 19.
- A. W. van der Vaart and Jon A. Wellner, Weak Convergence and Empirical Processes, Springer, 1996, Chapter 2.
- Patrick Billingsley, Convergence of Probability Measures, 2nd ed., Wiley, 1999.
- Shai Shalev-Shwartz and Shai Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Chapter 2.