“学习理论中的 “approximately correct” 通常使用加性风险误差。不可知 PAC 学习要求 $R D(\widehat h)\le\inf {h\in H}R D(h)+\…”
概念图像 ​
统计学习有两道彼此独立的缝:有限样本让经验风险偏离总体风险,有限计算又让算法停在经验最优值之上。近似 ERM 专门量第二道缝。它不是“训练得不够久”的口语说法,而是把优化器真正交付的经验目标值与类内最优值放在同一标尺上比较。
定义 ​
对样本
就称它是加性
优化误差怎样进入风险界 ​
设
成立。沿着总体风险、经验风险、经验最优和总体最优依次比较,得到
因此优化误差在这个基本分解中按加法进入;没有统一泛化事件时,仅知道训练目标接近最优并不能推出总体风险接近最优。
一个真实的停止情形 ​
训练凸 Lipschitz 损失时,迭代算法可能在可验证的 primal gap 降到
边界与辨析 ​
梯度范数小、参数移动小或迭代次数多,都不是经验风险次优的定义;把它们转成
关系 ​
本页把经验风险最小化的精确 argmin 放宽为实际可计算的输出,并把误差交给超额风险分解。数值优化中的 stopping criterion 只有在能证明控制经验目标 gap 时,才可作为这里的证书。
参考资料
- Shai Shalev-Shwartz et al., Stochastic Convex Optimization, COLT 2011.
- Léon Bottou, Frank E. Curtis, Jorge Nocedal, Optimization Methods for Large-Scale Machine Learning, SIAM Review, 2018.