Skip to content

正则化经验风险最小化

regularized ERM · RERM

在经验拟合项上加入结构惩罚,以显式控制解的复杂度与统计—优化权衡。

条目类型
原则

形式陈述

ERM只问哪一个候选在样本上犯错最少;正则化 ERM 同时问,为换取这点拟合改善付出了多复杂的规则。它把两种代价写进同一个目标,而不是在训练结束后凭印象挑一个“更简单”的模型。

形式定义

给定惩罚泛函 Ω:HR{+}λ0,正则化 ERM 求解

h^λargminhH{R^S(h)+λΩ(h)}.

λ 决定经验拟合与惩罚的交换率。若 Ω 是凸函数且经验风险凸,这仍是凸优化问题;若惩罚强凸,还可能给解的唯一性和算法稳定性。

约束形式 minR^S(h) subject to Ω(h)r 与惩罚形式常由 Lagrange 乘子联系,但并非对任意非凸问题或任意 r 都存在一一对应的 λ。显式惩罚也不同于早停、初始化或优化动态产生的隐式偏置:后者没有把 Ω 直接写进目标。

直觉

正则项为复杂行为标出价格,λ 则规定一单位经验拟合值得牺牲多少结构代价。它既可能缩小有效搜索范围,也可能为优化目标增加曲率;统计控制与数值改善来自同一项,却需要各自的定理。

例子与边界

岭回归例子

赋范向量空间中的线性回归里,令 hw(x)=w,x,平方损失配合 Ω(w)=w22 得到岭目标

1mi=1m(w,xiyi)2+λw22.

当特征高度共线时,二次惩罚抑制大范数方向并改善条件性;在统计解释中,它也限制可选线性函数的有效范围。两种作用相关,却不是同一个结论:数值上更稳定不自动证明总体风险更低。

推导出的权衡

与类内最优 h 比较时,正则化最优性给出

R^S(h^λ)R^S(h)λ(Ω(h)Ω(h^λ)).

右侧显示正则器允许牺牲拟合以换取较小惩罚。最终是否有利,要把这项与由范数、稳定性或复杂度得到的泛化界共同分析;仅看正则化目标值不能完成论证。

边界与相邻概念

参数范数依赖表示。两层线性网络可通过一层乘常数、另一层除常数保持同一函数,却改变单层参数范数,所以“参数小”不总等于“函数类简单”。L1 惩罚常产生稀疏解,但相关特征、优化精度和参数化都可能破坏“恢复真实稀疏结构”的断言;L2 也不保证每个分布上都改善泛化。

本页处理一个连续目标中的惩罚;结构风险最小化则在可数模型层之间分配置信度并选择层级。二者可以组合,但不能把任意超参数搜索都称为 SRM。

推论与应用

强凸正则化常把单点目标扰动转成小的参数变化,再由 Lipschitz 损失推出算法稳定性泛化界。范数约束也可进入 Rademacher 或 margin 复杂度,使正则参数同时影响逼近误差与估计误差。

岭回归、稀疏回归与核方法都可写成这一模板,但惩罚的几何必须与函数表示相匹配。若 λ 由同一数据反复选择,还要把模型选择过程计入验证或复杂度分析。

参考资料
  • Andrey N. Tikhonov, Solution of Incorrectly Formulated Problems and the Regularization Method, 1963.
  • Olivier Bousquet, André Elisseeff, Stability and Generalization, JMLR, 2002.
关系图谱10 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系