Skip to content

经验风险最小化

Empirical risk minimization · ERM

在假设类中选择训练样本平均损失最小的规则。

选择原则

给定样本 S=(Z1,,Zm)、假设类 H 与逐点损失 ,经验风险是

R^S(h)=1mi=1m(h,Zi).

经验风险最小化(ERM)要求学习器选择

A(S)argminhHR^S(h).

它规定在什么准则下选择预测器,不规定怎样计算。枚举、排序或凸优化都可能实现同一原则;算法名称、参数表示和 ERM 定义不是同一层。

若最小值没有达到,或计算预算只允许近似求解,应明确使用加性近似 ERM:

R^S(h^)infhHR^S(h)+εopt.

多解时还须有可测 tie-breaking,才能把 SA(S) 作为随机对象。

阈值扫描:原则与实现闭环

对实线阈值类,按 xi 排序后,经验标注只会在相邻样本点之间改变。因此扫描 m+1 个切分位置即可找出经验风险最小值;这是阈值类的高效实现,不是 ERM 一般定义的一部分。

样本 (1,0),(2,0),(4,1),(7,1) 上,任何 a(2,4) 都给出零经验错误。若算法规定返回相邻样本的中点,就得到 a=3。这项规则不改变最优值,却把多值的 argmin 变成确定、可复现的输出。

何时能泛化

ERM 只保证训练平均不高。要把这一选择转成总体风险保证,需要同时控制整个假设类上的经验风险与总体风险;只对每个预先固定的 h 分别集中,不能直接用于看过数据后才选出的 A(S)。完整的一致收敛、稳定性或局部复杂度论证属于后继页面。

取所有二元函数作为 H 时,ERM 可以记住任意有限训练集,却在未见点上没有共同结构。这个反例说明 ERM 不是泛化定理,也不是“训练误差低”的另一种说法。近似 ERM 的总体风险界还会额外携带 εopt,但前提仍是统计误差受到控制。

存在性与计算边界

ERM 可能不存在。若 H={ha:a>0} 且经验风险随 a0 逼近零、但 a=0 不在类中,那么只有下确界而没有 argmin。允许近似 ERM 或给参数域加入适当的紧致性条件可以修复选择问题;随手写“取一个最小者”则是假定了尚未证明存在的对象。

经验目标的加性次优是最直接的优化接口。乘法近似在最优经验风险可能为零时没有稳定含义,参数距离也会因重参数化而改变;“梯度很小”只有结合曲率或全局证书时,才能推出经验目标接近最优。统计保证应使用真正得到证明的优化量。

正则化 ERM 最小化 R^(h)+λΩ(h),它不是原经验风险上的 ERM,除非把惩罚明确并入新的损失或约束类。正则项带来的统计偏置、优化曲率和数值稳定性应分别分析。

把假设类换成参数空间、把经验预测损失换成一般随机准则,就得到更宽的M-估计框架。这个包含关系有助于迁移 argmin 和近似选择语言,但理解 ERM 不需要先掌握 M-估计的一致性或渐近理论。

参考资料
  • Vladimir Vapnik, Statistical Learning Theory, 1998.
  • Shalev-Shwartz, Ben-David, Understanding Machine Learning, Ch. 4.