样本对象
设 ( Z , A ) 是可测空间,D 是其上的概率分布。随机变量 Z 1 , … , Z m 若相互独立 公理库 独立性 Statistical independence 若干 σ-代数的任意有限事件选择都按概率乘积分解的性质。 且每个都服从 D ,就称为来自 D 的大小为 m 的 IID 样本。将观测按抽取顺序写成
S = ( Z 1 , … , Z m ) ∼ D m , 其中 D m 是乘积测度 公理库 乘积测度 Product measure 在乘积 σ-代数上把可测矩形的测度规定为边测度乘积的测度。 。S 是一个随机向量;观测完成后得到的 ( z 1 , … , z m ) 才是一份具体数据。把训练集与生成它的分布混成同一个对象,会掩盖学习保证中的概率究竟对谁取。
“同分布”只说明每个坐标的边缘分布相同,并不推出独立。例如令 Z 1 = ⋯ = Z m = Z ,各坐标都服从 D ,却只包含一次随机信息。反之,独立但边缘分布各异的数据也不是 IID。
经验测度与经验平均
给定实现值 S = ( z 1 , … , z m ) ,定义
D ^ S = 1 m ∑ i = 1 m δ z i , δ z 是点 z 处的 Dirac 概率测度。于是对任意可积函数 f ,
∫ f d D ^ S = 1 m ∑ i = 1 m f ( z i ) =: P m f . 这个等式把“数据上的平均”写成对经验分布的积分。经验测度确实是概率测度,但一般不等于 D ;它把全部质量放在有限个观测点上。大数律 公理库 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 说明对固定 f ,P m f 在条件合适时趋近 P f = ∫ f d D ,却不自动给出对一个巨大函数类同时成立的收敛。
顺序、多重性与统计量
有序元组保留抽样次序;多重集忽略次序但保留重复次数;集合会连重复次数也丢掉。对样本均值、经验风险这类置换不变统计量,前两种表示给出同一数值,概率模型仍通常从 D m 的有序坐标出发。若连续分布下重复点概率为零,这一区分看似无关;在离散标签、分桶数据和 bootstrap 中,重复次数正是经验质量,不能删除。
二分类时 Z i = ( X i , Y i ) 。对分类器 h 取 f h ( x , y ) = 1 { h ( x ) ≠ y } ,则 P m f h 正是经验错误率;总体错误率则是 P f h 。这条对应关系是经验风险与泛化间隙 公理库 经验风险与泛化间隙 Empirical risk · Generalization gap 训练平均损失与总体风险之差,以及数据依赖选择带来的困难。 的测度论底座。
不适用的采样机制
有限总体不放回抽样的坐标彼此负相关;时间序列常有自相关;在线学习和赌博机中的第 t 个观测还依赖此前选择。它们都可能拥有相同边缘分布,却不能直接使用 D m 模型及其 IID 集中结论。此时应明确有限总体修正、混合条件、鞅或自适应数据分析工具,而不是把“样本很多”当成独立性的替代品。
若 S = ( a , a , b ) ,经验测度是 D ^ S = 2 3 δ a + 1 3 δ b ;它保留重复次数,而集合 { a , b } 会错误地各分配一半质量。对 f ( a ) = 0 , f ( b ) = 3 ,经验平均为 1,恰等于对该经验测度积分。这个简单算例说明为何训练数据应视为多重观测,而不是去重后的点集。
经验测度作为随机测度的波动取决于测试函数族。对单个有界 f ,Hoeffding 控制 P m f − P f ;若要求对所有可测指示函数同时控制,类可选择样本未见集合,使偏差不消失。经验分布“弱收敛”或某个统计量一致,并不自动等于在任意函数类上总变差收敛。
参考资料
A. W. van der Vaart, Asymptotic Statistics , Cambridge University Press, 1998, Chs. 2 and 19.
Shai Shalev-Shwartz, Shai Ben-David, Understanding Machine Learning , Cambridge University Press, 2014, Ch. 2.