Skip to content

经验风险与泛化间隙

Empirical risk · Generalization gap

训练平均损失与总体风险之差,以及数据依赖选择带来的困难。

条目类型
定义

形式陈述

IID 样本 S=(Z1,,Zm)Dm,经验风险是损失关于经验测度的积分:

R^S(h)=Pmh=1mi=1m(h,Zi),RD(h)=Ph.

本文固定有向泛化间隙

gapS(h)=RD(h)R^S(h).

正 gap 表示训练损失低估样本外损失;负 gap 表示这份样本上的平均损失较高。绝对间隙 |gapS(h)| 忽略方向。所有概率陈述都假设相应损失、上确界与数据依赖输出可测,或采用标准外概率约定。

固定 h 且损失在 [0,1] 时,经验风险无偏:ESR^S(h)=RD(h)。Hoeffding 进一步给出

Pr(|RD(h)R^S(h)|>ε)2e2mε2.

“固定”是关键。若 h^=A(S) 从同一数据的海量候选中选出,它与经验噪声相关,不能事后代入固定假设界。有限类可用并集界同时控制;无限类需要 VC、Rademacher 或算法稳定性等结构。

直觉

固定规则的经验均值像一把事先放好的尺子;数据依赖选择却会在看见噪声后挑选最有利的尺子。每个候选单独都集中,不代表被挑中的极值仍服从同一个固定对象界。泛化理论需要额外控制这次选择所获得的自由度。

经验风险与总体风险的间隙
例子与边界

从百万个无信号特征中挑训练相关最大的一个,最大值会系统性偏高,尽管每个预先指定特征都集中。大数律没有失效;算法把“先固定规则再抽样”改成了“看完样本再取极值”。反复查看测试集调参也使最终预测器依赖测试数据,固定规则评价保证随之失效。

训练误差低只说明拟合样本;所有函数类可把训练错误降为零而任意预测未见点。泛化间隙也不等于超额风险:前者比较同一 h 在两个分布上的风险,后者比较两个规则的总体风险。

具体地,设 m=100,固定分类器真实错误率为 0.2,训练中恰错了 15 个点,则 R^=0.15、有向 gap 为 0.05。这个数是本次样本的实现值,不是算法必然高估或低估的系统偏差。若在一万个独立候选中专挑错误最少者,即使每个候选都同样只有 0.2 总体风险,被选者的训练错误也会因取最小值而偏低。

对数据依赖输出,需要控制随机量 R(A(S))R^S(A(S))。一致收敛通过同时控制全部候选解决选择问题;算法稳定性则直接证明替换一个样本不会明显改变输出风险。这两条路线针对同一 gap,却使用不同结构,不能把“存在泛化界”自动解释为类上必有最朴素的一致收敛。

训练、验证和测试的角色也由依赖关系区分。验证集参与超参数选择后,最终预测器依赖它,不能再把验证误差当固定规则的无偏报告;真正封存的测试集仍可评价整个选择流程。交叉验证通过多次重用数据降低方差,但各折估计相关,其置信分析不是把样本量简单乘上折数。

Gap 的期望为零只对预先固定 h 的无偏经验均值成立。对 ERM 输出,选择最小经验风险通常造成负的经验偏差,所以期望 gap 往往为正。这个“乐观训练误差”是数据复用的结果,不需要假设训练程序有意作弊。

推论与应用

一致收敛在同一高概率事件上控制整类假设,因此能安全覆盖 ERM 的数据依赖输出;算法稳定性则绕过整类容量,直接限制替换一个样本时算法输出损失的变化。两条路线都在控制本页 gap,却依赖不同结构。

模型选择和测试复用把同一问题带到实践协议中。一次封存留出集可评价已经固定的训练流程;反复根据测试分数迭代时,评价对象重新依赖数据,需要嵌套交叉验证、自适应数据分析或新的独立样本来恢复可解释的样本外证据。

参考资料
  • Vapnik, Chervonenkis, “Uniform Convergence of Relative Frequencies,” 1971.
  • Shalev-Shwartz, Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Chs. 4–6.
关系图谱22 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

使用的工具