“二分类时 $Z i=(X i,Y i)$。对分类器 $h$ 取 $f h(x,y)=\mathbf1{h(x)\ne y}$,则 $P mf h$ 正是经验错误率;总体错误率则是 $Pf h…”
两个风险 ​
对
绝对间隙则忽略偏高或偏低。正 gap 表示训练损失低估样本外损失;负 gap 只说明这份样本较难。
固定
“固定”是关键。若
选择偏差与边界 ​
从百万个无信号特征中挑训练相关最大的一个,最大值会系统性偏高,尽管每个预先指定特征都集中。这不是大数律失效,而是选择改变了量词。反复查看测试集调参也使最终预测器依赖测试数据,固定规则评价保证随之失效。
训练误差低只说明拟合样本;所有函数类可把训练错误降为零而任意预测未见点。泛化间隙也不等于超额风险:前者比较同一
具体地,设
对数据依赖输出,真正要控制的是随机量
训练、验证和测试的角色也由依赖关系区分。验证集参与超参数选择后,最终预测器依赖它,不能再把验证误差当固定规则的无偏报告;真正封存的测试集仍可评价整个选择流程。交叉验证通过多次重用数据降低方差,但各折估计相关,其置信分析不是把样本量简单乘上折数。
Gap 的期望为零只对预先固定
参考资料
- Vapnik, Chervonenkis, “Uniform Convergence of Relative Frequencies,” 1971.
- Shalev-Shwartz, Ben-David, Understanding Machine Learning, Chs. 4–6.