Skip to content

正则化经验风险最小化

regularized ERM · RERM

在经验拟合项上加入结构惩罚,以显式控制解的复杂度与统计—优化权衡。

概念图像

纯 ERM 只问哪一个候选在样本上犯错最少;正则化 ERM 同时问,为换取这点拟合改善付出了多复杂的规则。它把两种代价写进同一个目标,而不是在训练结束后凭印象挑一个“更简单”的模型。

形式定义

给定惩罚泛函 Ω:HR{+}λ0,正则化 ERM 求解

h^λargminhH{R^S(h)+λΩ(h)}.

λ 决定经验拟合与惩罚的交换率。若 Ω 是凸函数且经验风险凸,这仍是凸优化问题;若惩罚强凸,还可能给解的唯一性和算法稳定性。

约束形式 minR^S(h) subject to Ω(h)r 与惩罚形式常由 Lagrange 乘子联系,但并非对任意非凸问题或任意 r 都存在一一对应的 λ。显式惩罚也不同于早停、初始化或优化动态产生的隐式偏置:后者没有把 Ω 直接写进目标。

岭回归例子

在线性回归中,令 hw(x)=w,x,平方损失配合 Ω(w)=w22 得到岭目标

1mi=1m(w,xiyi)2+λw22.

当特征高度共线时,二次惩罚抑制大范数方向并改善条件性;在统计解释中,它也限制可选线性函数的有效范围。两种作用相关,却不是同一个结论:数值上更稳定不自动证明总体风险更低。

推导出的权衡

与类内最优 h 比较时,正则化最优性给出

R^S(h^λ)R^S(h)λ(Ω(h)Ω(h^λ)).

右侧显示正则器允许牺牲拟合以换取较小惩罚。最终是否有利,要把这项与由范数、稳定性或复杂度得到的泛化界共同分析;仅看正则化目标值不能完成论证。

边界与相邻概念

参数范数依赖表示。两层线性网络可通过一层乘常数、另一层除常数保持同一函数,却改变单层参数范数,所以“参数小”不总等于“函数类简单”。L1 惩罚常产生稀疏解,但相关特征、优化精度和参数化都可能破坏“恢复真实稀疏结构”的断言;L2 也不保证每个分布上都改善泛化。

本页处理一个连续目标中的惩罚;结构风险最小化则在可数模型层之间分配置信度并选择层级。二者可以组合,但不能把任意超参数搜索都称为 SRM。

参考资料
  • Andrey N. Tikhonov, Solution of Incorrectly Formulated Problems and the Regularization Method, 1963.
  • Olivier Bousquet, André Elisseeff, Stability and Generalization, JMLR, 2002.