Skip to content

定义Definition

经验风险与泛化间隙

Empirical risk · Generalization gap

训练平均损失与总体风险之差,以及数据依赖选择带来的困难。

形式陈述 ​

给定有限非空观测序列 S=(Z1,…,Zm),m≥1,及目标分布 D,经验风险是损失关于经验测度的积分:

R^S(h)=Pmℓh=1m∑i=1mℓ(h,Zi),RD(h)=Pℓh.

这里 Pm=m−1∑iδZi,而 P=D。这些平均和风险差对任意固定数据都能计算;讨论无偏性与下面的 Hoeffding 概率界时,另假定 S∼Dm 是IID 样本。以下讨论风险差时,假定所比较的总体风险与经验风险均为有限实数,排除 ∞−∞。本文固定有向泛化间隙

gapS(h)=RD(h)−R^S(h).

正 gap 表示训练损失低估样本外损失;负 gap 表示这份样本上的平均损失较高。注意 RD(h) 本身不是另一份有限测试集的平均值;测试误差是它的另一个随机估计,也有自己的抽样波动。绝对间隙 |gapS(h)| 忽略方向。所有概率陈述都假设相应损失、上确界与数据依赖输出可测,或采用标准外概率约定。

固定 h 且损失在 [0,1] 时,经验风险无偏:ESR^S(h)=RD(h)。Hoeffding 不等式进一步给出

Pr(|RD(h)−R^S(h)|>ε)≤2e−2mε2.

“固定”是关键。若 h^=A(S) 从同一数据的海量候选中选出,它与经验噪声相关,不能事后代入固定假设界。有限类可用并集界同时控制;无限类需要 VC、Rademacher 或算法稳定性等结构。

直觉

固定规则的经验均值像一把事先放好的尺子;数据依赖选择却会在看见噪声后挑选最有利的尺子。每个候选单独都集中,不代表被挑中的极值仍服从同一个固定对象界。泛化理论需要额外控制这次选择所获得的自由度。

经验风险与总体风险的间隙
例子与边界

选择偏差可以用只有一条训练数据的实验精确算出。令 Y 为公平二元标签,候选只有常数规则 h0≡0 与 h1≡1。每个固定规则的总体错误都是 1/2,训练错误的期望也都是 1/2。ERM 看见唯一标签后选择 hY,于是训练错误恒为 0,独立新标签上的错误却仍为 1/2,gap 恒为 1/2。两条分别无偏的估计,经“挑较小者”后便不再无偏。

从百万个无信号特征中挑训练相关最大的一个,是同一机制的更大规模版本。大数律没有失效;算法把“先固定规则再抽样”改成了“看完样本再取极值”。反复查看测试集调参也会使最终预测器依赖测试数据。

训练误差低只说明拟合样本;所有函数类可把训练错误降为零而任意预测未见点。泛化间隙也不等于超额风险:前者比较同一 h 在两个分布上的风险,后者比较两个规则的总体风险。

具体地,设 m=100,固定分类器真实错误率为 0.2,训练中恰错了 15 个点,则 R^=0.15、有向 gap 为 0.05。这个数是本次样本的实现值,不是算法必然高估或低估的系统偏差。

对数据依赖输出,需要控制随机量 R(A(S))−R^S(A(S))。若有限类有 N 个候选,分别使用固定规则的 Hoeffding 界再求并,可得失败概率至多 2Ne−2mε2。让它不超过 δ,需 m≥log⁡(2N/δ)/(2ε2);多出的 log⁡N 正是在控制挑选自由度。无限类的一致收敛需要别的容量工具;算法稳定性则直接研究样本替换对所选规则损失的影响,未必要求整类都统一集中。

训练、验证和测试的角色也由依赖关系区分。验证集参与超参数选择后,最终预测器依赖它,不能再把验证误差当固定规则的无偏报告;真正封存的测试集仍可评价整个选择流程。交叉验证让多个划分共同参与评价,减少对某一次划分的依赖,但不保证在所有问题中都降低方差;各折估计相关,其置信分析也不能把样本量简单乘上折数。

推论与应用

一致收敛在同一高概率事件上控制整类假设,因此能安全覆盖 ERM 的数据依赖输出;算法稳定性则绕过整类容量,直接限制替换一个样本时算法输出损失的变化。两条路线都在控制本页 gap,却依赖不同结构。

模型选择和测试复用把同一问题带到实践协议中。一次封存留出集可评价已经固定的训练流程;反复根据测试分数迭代时,评价对象重新依赖数据,需要嵌套交叉验证、自适应数据分析或新的独立样本来恢复可解释的样本外证据。

参考资料
  • Mehryar Mohri,Learning with Finite Hypothesis Sets,Foundations of Machine Learning 课程讲义(访问于 2026-09-22),第 6–8、17–19 页:总体与经验错误、PAC 量词、有限类一致学习的并集界。

  • Vapnik, Chervonenkis, “Uniform Convergence of Relative Frequencies,” 1971.

  • Shalev-Shwartz, Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Chs. 4–6.

关系图谱33 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系