Skip to content

独立同分布样本与经验测度

IID sample · Empirical measure

用乘积分布描述独立重复观测,并把有限样本写成可积分的经验分布。

样本对象

(Z,A) 是可测空间,D 是其上的概率分布。随机变量 Z1,,Zm 若相互独立且每个都服从 D,就称为来自 D 的大小为 m 的 IID 样本。将观测按抽取顺序写成

S=(Z1,,Zm)Dm,

其中 Dm乘积测度S 是一个随机向量;观测完成后得到的 (z1,,zm) 才是一份具体数据。把训练集与生成它的分布混成同一个对象,会掩盖学习保证中的概率究竟对谁取。

“同分布”只说明每个坐标的边缘分布相同,并不推出独立。例如令 Z1==Zm=Z,各坐标都服从 D,却只包含一次随机信息。反之,独立但边缘分布各异的数据也不是 IID。

经验测度与经验平均

给定实现值 S=(z1,,zm),定义

D^S=1mi=1mδzi,

δz 是点 z 处的 Dirac 概率测度。于是对任意可积函数 f

fdD^S=1mi=1mf(zi)=:Pmf.

这个等式把“数据上的平均”写成对经验分布的积分。经验测度确实是概率测度,但一般不等于 D;它把全部质量放在有限个观测点上。大数律说明对固定 fPmf 在条件合适时趋近 Pf=fdD,却不自动给出对一个巨大函数类同时成立的收敛。

顺序、多重性与统计量

有序元组保留抽样次序;多重集忽略次序但保留重复次数;集合会连重复次数也丢掉。对样本均值、经验风险这类置换不变统计量,前两种表示给出同一数值,概率模型仍通常从 Dm 的有序坐标出发。若连续分布下重复点概率为零,这一区分看似无关;在离散标签、分桶数据和 bootstrap 中,重复次数正是经验质量,不能删除。

二分类时 Zi=(Xi,Yi)。对分类器 hfh(x,y)=1{h(x)y},则 Pmfh 正是经验错误率;总体错误率则是 Pfh。这条对应关系是经验风险与泛化间隙的测度论底座。

不适用的采样机制

有限总体不放回抽样的坐标彼此负相关;时间序列常有自相关;在线学习和赌博机中的第 t 个观测还依赖此前选择。它们都可能拥有相同边缘分布,却不能直接使用 Dm 模型及其 IID 集中结论。此时应明确有限总体修正、混合条件、鞅或自适应数据分析工具,而不是把“样本很多”当成独立性的替代品。

S=(a,a,b),经验测度是 D^S=23δa+13δb;它保留重复次数,而集合 {a,b} 会错误地各分配一半质量。对 f(a)=0,f(b)=3,经验平均为 1,恰等于对该经验测度积分。这个简单算例说明为何训练数据应视为多重观测,而不是去重后的点集。

经验测度作为随机测度的波动取决于测试函数族。对单个有界 f,Hoeffding 控制 PmfPf;若要求对所有可测指示函数同时控制,类可选择样本未见集合,使偏差不消失。经验分布“弱收敛”或某个统计量一致,并不自动等于在任意函数类上总变差收敛。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998, Chs. 2 and 19.
  • Shai Shalev-Shwartz, Shai Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Ch. 2.