Skip to content

经验风险最小化

Empirical risk minimization · ERM

在假设类中选择训练样本平均损失最小的规则。

条目类型
原则

形式陈述

给定IID 样本 S=(Z1,,Zm)假设类 H逐点损失 经验风险

R^S(h)=1mi=1m(h,Zi).

经验风险最小化(ERM)要求学习器选择

A(S)argminhHR^S(h).

它规定在什么准则下选择预测器,不规定怎样计算。枚举、排序或凸优化都可能实现同一原则;算法名称、参数表示和 ERM 定义不是同一层。

若最小值没有达到,或计算预算只允许近似求解,应明确使用加性近似 ERM:

R^S(h^)infhHR^S(h)+εopt.

多解时还须指定可测的 tie-breaking,才能把 SA(S) 作为随机对象。对不可数类,argmin 集合的可测选择并非自动存在;常见处理是要求参数空间与准则满足标准可分性、下半连续性和紧致性条件,或直接使用可测近似 ERM。

直觉

ERM 用样本平均替代无法直接计算的总体期望,再在同一个比较类中寻找最小者。它是一条选择原则,不是一种特定优化器:统计部分问经验排序能否代表总体排序,计算部分问怎样找到或近似找到经验最优,两者必须分别证明。

经验风险的类内最小者
例子与边界

阈值扫描:原则与实现闭环

对实线阈值类,按 xi 排序后,经验标注只会在相邻样本点之间改变。因此扫描 m+1 个切分位置即可找出经验风险最小值;这是阈值类的高效实现,不是 ERM 一般定义的一部分。

样本 (1,0),(2,0),(4,1),(7,1) 上,任何 a(2,4) 都给出零经验错误。若算法规定返回相邻样本的中点,就得到 a=3。这项规则不改变最优值,却把多值的 argmin 变成确定、可复现的输出。

何时能泛化

ERM 只保证训练平均不高。要把这一选择转成总体风险保证,需要同时控制整个假设类上的经验风险与总体风险;只对每个预先固定的 h 分别集中,不能直接用于看过数据后才选出的 A(S)。完整的一致收敛、稳定性或局部复杂度论证属于后继页面。

取所有二元函数作为 H 时,ERM 可以记住任意有限训练集,却在未见点上没有共同结构。这个反例说明 ERM 不是泛化定理,也不是“训练误差低”的另一种说法。近似 ERM 的总体风险界还会额外携带 εopt,但前提仍是统计误差受到控制。

存在性与计算边界

ERM 可能不存在。令 H={ha:a>0} 为常数预测器 ha(x)=a,样本只有标签 Y=0,损失为平方损失。此时

R^S(ha)=a2,infa>0R^S(ha)=0,

但没有任何 a>0 达到零,所以 argmin 为空。允许近似 ERM,或把参数域闭合并证明准则在紧集上达到最小值,才能修复选择问题;直接写“取一个最小者”已经暗含存在性假设。

经验目标的加性次优是最直接的优化接口。乘法近似在最优经验风险可能为零时没有稳定含义,参数距离也会因重参数化而改变;“梯度很小”只有结合曲率或全局证书时,才能推出经验目标接近最优。统计保证应使用真正得到证明的优化量。

正则化 ERM 最小化 R^(h)+λΩ(h),它不是原经验风险上的 ERM,除非把惩罚明确并入新的损失或约束类。正则项带来的统计偏置、优化曲率和数值稳定性应分别分析。

把假设类换成参数空间、把经验预测损失换成一般随机准则,就得到更宽的M-估计框架。这个包含关系有助于迁移 argmin 和近似选择语言,但理解 ERM 不需要先掌握 M-估计的一致性或渐近理论。

推论与应用

若好事件上 suph|R(h)R^(h)|εgen,且输出满足加性 εopt-ERM 条件,则对任意类内近似最优比较器加减经验风险可得

R(h^)infhHR(h)2εgen+εopt.

VC 维、Rademacher 复杂度和有限类并集界分别提供统一偏差控制;优化误差则作为独立项进入超额风险,而不会被统计误差自动吸收。

正则化 ERM 与结构风险最小化进一步改变选择准则:前者在一个经验目标中加入复杂度惩罚,后者在多个嵌套类间平衡拟合与置信半径。它们都继承 ERM 的经验比较逻辑,但必须明确新的基准、惩罚与计算接口。

参考资料
  • Vladimir Vapnik, Statistical Learning Theory, 1998.
  • Shalev-Shwartz, Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Ch. 4.
关系图谱13 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系