“总体错误率是 (\int f h,dD),经验错误率是 (\int f h,d\widehat D s)。泛化间隙正是这两个积分之差。这里 IID 决定如何对训练集随机性做概率控制,经验测度…”
形式陈述 ​
本文固定有向泛化间隙
正 gap 表示训练损失低估样本外损失;负 gap 表示这份样本上的平均损失较高。绝对间隙
固定
“固定”是关键。若
直觉
固定规则的经验均值像一把事先放好的尺子;数据依赖选择却会在看见噪声后挑选最有利的尺子。每个候选单独都集中,不代表被挑中的极值仍服从同一个固定对象界。泛化理论需要额外控制这次选择所获得的自由度。
例子与边界
从百万个无信号特征中挑训练相关最大的一个,最大值会系统性偏高,尽管每个预先指定特征都集中。大数律没有失效;算法把“先固定规则再抽样”改成了“看完样本再取极值”。反复查看测试集调参也使最终预测器依赖测试数据,固定规则评价保证随之失效。
训练误差低只说明拟合样本;所有函数类可把训练错误降为零而任意预测未见点。泛化间隙也不等于超额风险:前者比较同一
具体地,设
对数据依赖输出,需要控制随机量
训练、验证和测试的角色也由依赖关系区分。验证集参与超参数选择后,最终预测器依赖它,不能再把验证误差当固定规则的无偏报告;真正封存的测试集仍可评价整个选择流程。交叉验证通过多次重用数据降低方差,但各折估计相关,其置信分析不是把样本量简单乘上折数。
Gap 的期望为零只对预先固定
推论与应用
一致收敛在同一高概率事件上控制整类假设,因此能安全覆盖 ERM 的数据依赖输出;算法稳定性则绕过整类容量,直接限制替换一个样本时算法输出损失的变化。两条路线都在控制本页 gap,却依赖不同结构。
模型选择和测试复用把同一问题带到实践协议中。一次封存留出集可评价已经固定的训练流程;反复根据测试分数迭代时,评价对象重新依赖数据,需要嵌套交叉验证、自适应数据分析或新的独立样本来恢复可解释的样本外证据。
参考资料
- Vapnik, Chervonenkis, “Uniform Convergence of Relative Frequencies,” 1971.
- Shalev-Shwartz, Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Chs. 4–6.