Skip to content

IID 样本与经验测度:从生成机制到数据摘要

检索别名:IID sample and empirical measure · Sampling-to-empirical-measure overview

把随机样本、观测实现和经验测度放在同一条统计推断流程中,并明确它们的量词与信息差异。

条目类型
导航

形式陈述

(Z,A) 是可测空间,D 是其上的概率分布。独立同分布样本描述数据的随机生成协议:

S=(Z1,,Zm)Dm,

其中各 Zi 相互独立且都服从 DS 是随机向量;实验完成后得到的

s=(z1,,zm)

才是一份具体数据。概率、期望和高概率保证通常对随机样本 S 取量词,而算法在输入实现值 s 后进行确定性或条件随机计算。

经验测度把这份有限数据编码为

D^s=1mi=1mδzi.

对任意可积函数 f,有

fdD^s=1mi=1mf(zi).

因此,经验测度把样本平均改写成对一个原子概率测度的积分。若输入仍写成随机样本 S,则 D^S 是随机测度;条件于 S=s 后,它又是普通的确定性概率测度。

IID 与经验测度属于不同层次。IID 是联合分布假设,经验测度是对任意有限序列都可执行的数据变换。依赖数据、时间序列或人为选取的点同样拥有经验测度,却不服从 Dm;反过来,研究 IID 样本的完整似然、顺序统计量或坐标事件时,也未必需要先把数据压缩成经验测度。

直觉

可以把统计流程分成四层:总体机制 D 产生随机样本 S,随机样本实现为数据 s,数据再映射为经验测度 D^s。前两步属于概率模型,最后一步属于表示选择。把四层混成“样本分布”,很容易不清楚某个等式究竟是定义、随机变量恒等式还是渐近结论。

经验测度为每次观测分配质量 1/m。重复值的质量会累加,抽取顺序则被忽略。因此它比集合保留更多信息,又比有序元组保留更少信息。对于经验风险、样本均值等置换不变统计量,这种压缩恰到好处;对于时间顺序、依赖结构或序列似然,它会丢掉关键内容。

IID 假设的作用不是让经验测度“成为概率分布”——它无论如何都是概率测度。IID 提供的是关于 D^S 如何围绕总体 D 波动的概率规律。大数律、集中不等式和经验过程理论都建立在这一区别上。

例子与边界

s=(a,a,b),则

D^s=23δa+13δb.

把数据误写成集合 {a,b} 并均匀赋权,会把两个点都置为质量 1/2,从而删除重复次数。若 f(a)=0,f(b)=3,真实经验平均为 1,而去重后的平均为 3/2。这里不是“换一组数字”的装饰性算例,而是在展示集合、多重集和经验测度承载的信息确实不同。

二分类中令 Zi=(Xi,Yi),并对分类器 h 取损失

fh(x,y)=1{h(x)y}.

总体错误率是 fhdD,经验错误率是 fhdD^s泛化间隙正是这两个积分之差。这里 IID 决定如何对训练集随机性做概率控制,经验测度则负责把训练损失写成统一的积分对象。

有限总体不放回抽样通常带有负相关;时间序列含有自相关;在线学习和 bandit 中第 t 个观测依赖此前动作。这些数据仍能形成经验测度,却不能直接使用 Dm 下的 IID 集中结论。相应分析需要有限总体修正、混合条件、鞅工具或自适应数据理论。

经验测度也不在所有距离下逼近总体。若 D 连续,而 D^S 只支持在有限个点上,两者的总变差距离通常保持最大;但对固定有界连续函数,经验积分可以收敛。声称“经验分布趋近真实分布”时,必须说明采用弱收敛、Wasserstein 距离、某个函数类上的一致偏差,还是其他具体拓扑。

推论与应用

对固定可积函数 f大数律在适当条件下给出

fdD^SfdD.

固定函数的收敛只控制一个随机量。学习理论需要同时控制一整个损失函数类,因而还要引入 VC 维、Rademacher 复杂度、覆盖数或稳定性。样本量增大并不会自动消除模型类选择带来的适应性。

Bootstrap 从经验测度 D^S 再抽样,以数据驱动方式近似统计量的抽样分布;核密度估计把经验原子与核卷积,得到平滑估计;经验风险最小化则在候选函数之间比较经验积分。三者都从同一个数据摘要出发,却加入了不同的算法与统计假设。

拆开生成协议和经验对象还有一个直接好处:推广到非 IID 数据时,只需替换随机样本模型,经验测度的定义无需改变;改用加权经验测度、在线平均或依赖结构摘要时,也不必把总体分布假设一并重写。关系清楚之后,哪些结论来自采样,哪些只是代数恒等式,便能逐项检查。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998, Chapters 2 and 19.
  • A. W. van der Vaart and Jon A. Wellner, Weak Convergence and Empirical Processes, Springer, 1996, Chapter 2.
  • Patrick Billingsley, Convergence of Probability Measures, 2nd ed., Wiley, 1999.
  • Shai Shalev-Shwartz and Shai Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Chapter 2.
术语导航仅作分流

沿正文链接进入正式概念页;本页不参与六类关系。