Skip to content

近似 ERM 与优化误差

approximate ERM · optimization error

刻画训练目标未被精确最小化时,经验次优量如何进入总体超额风险。

概念图像

统计学习有两道彼此独立的缝:有限样本让经验风险偏离总体风险,有限计算又让算法停在经验最优值之上。近似 ERM 专门量第二道缝。它不是“训练得不够久”的口语说法,而是把优化器真正交付的经验目标值与类内最优值放在同一标尺上比较。

定义

对样本 S、假设类 H 和经验风险 R^S,若输出 h^ 满足

R^S(h^)infhHR^S(h)+εopt,

就称它是加性 εopt-ERM。随机优化器的保证还要注明概率来源:例如以至少 1δopt 的概率成立,或只保证期望经验次优不超过 εopt。这两种陈述不能直接互换。

优化误差怎样进入风险界

hargminhHR(h),并且事件

suphH|R(h)R^S(h)|u

成立。沿着总体风险、经验风险、经验最优和总体最优依次比较,得到

R(h^)R(h)[R(h^)R^S(h^)]+εopt+[R^S(h)R(h)]2u+εopt.

因此优化误差在这个基本分解中按加法进入;没有统一泛化事件时,仅知道训练目标接近最优并不能推出总体风险接近最优。

一个真实的停止情形

训练凸 Lipschitz 损失时,迭代算法可能在可验证的 primal gap 降到 103 后停止。如果同一置信事件给出统一泛化项 u=0.02,则上式只承诺类内超额风险不超过 0.041,而不是 0.001。这解释了为什么把数值容差继续压到机器精度,往往不会改善由样本量主导的统计保证。

边界与辨析

梯度范数小、参数移动小或迭代次数多,都不是经验风险次优的定义;把它们转成 εopt 需要凸性、光滑性或误差界等额外条件。近似比使用乘法尺度,目标最优值为零、为负或允许平移时会失去合适语义,学习风险通常采用加性容差。还要区分优化容差 εopt 与 PAC 精度 ε:前者是算法求解目标的误差,后者约束最终总体风险。

关系

本页把经验风险最小化的精确 argmin 放宽为实际可计算的输出,并把误差交给超额风险分解。数值优化中的 stopping criterion 只有在能证明控制经验目标 gap 时,才可作为这里的证书。

参考资料