“后续可按目标分流:若关心固定样本平均,先读大数律,并尝试说明把 $(a,a,b)$ 改排成 $(b,a,a)$ 为什么不改变经验积分;若关心模型选择,读经验风险与泛化间隙,检查为什么选出的…”
“总体错误率是 (\int f h,dD),经验错误率是 (\int f h,d\widehat D s)。泛化间隙正是这两个积分之差。这里 IID 决定如何对训练集随机性做概率控制,经验测度…”
定义Definition
Empirical risk · Generalization gap
训练平均损失与总体风险之差,以及数据依赖选择带来的困难。
给定有限非空观测序列
这里
正 gap 表示训练损失低估样本外损失;负 gap 表示这份样本上的平均损失较高。注意
固定
“固定”是关键。若
固定规则的经验均值像一把事先放好的尺子;数据依赖选择却会在看见噪声后挑选最有利的尺子。每个候选单独都集中,不代表被挑中的极值仍服从同一个固定对象界。泛化理论需要额外控制这次选择所获得的自由度。
选择偏差可以用只有一条训练数据的实验精确算出。令
从百万个无信号特征中挑训练相关最大的一个,是同一机制的更大规模版本。大数律没有失效;算法把“先固定规则再抽样”改成了“看完样本再取极值”。反复查看测试集调参也会使最终预测器依赖测试数据。
训练误差低只说明拟合样本;所有函数类可把训练错误降为零而任意预测未见点。泛化间隙也不等于超额风险:前者比较同一
具体地,设
对数据依赖输出,需要控制随机量
训练、验证和测试的角色也由依赖关系区分。验证集参与超参数选择后,最终预测器依赖它,不能再把验证误差当固定规则的无偏报告;真正封存的测试集仍可评价整个选择流程。交叉验证让多个划分共同参与评价,减少对某一次划分的依赖,但不保证在所有问题中都降低方差;各折估计相关,其置信分析也不能把样本量简单乘上折数。
一致收敛在同一高概率事件上控制整类假设,因此能安全覆盖 ERM 的数据依赖输出;算法稳定性则绕过整类容量,直接限制替换一个样本时算法输出损失的变化。两条路线都在控制本页 gap,却依赖不同结构。
模型选择和测试复用把同一问题带到实践协议中。一次封存留出集可评价已经固定的训练流程;反复根据测试分数迭代时,评价对象重新依赖数据,需要嵌套交叉验证、自适应数据分析或新的独立样本来恢复可解释的样本外证据。
Mehryar Mohri,Learning with Finite Hypothesis Sets,Foundations of Machine Learning 课程讲义(访问于 2026-09-22),第 6–8、17–19 页:总体与经验错误、PAC 量词、有限类一致学习的并集界。
Vapnik, Chervonenkis, “Uniform Convergence of Relative Frequencies,” 1971.
Shalev-Shwartz, Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Chs. 4–6.