“给定训练输入 $x 1,\ldots,x m$、RKHS $\mathcal H k$、任意点值目标 $\Psi:\mathbb R^m\to\mathbb R\cup{+\infty}$,…”
形式陈述 ​
纯ERM只问哪一个候选在样本上犯错最少;正则化 ERM 同时问,为换取这点拟合改善付出了多复杂的规则。它把两种代价写进同一个目标,而不是在训练结束后凭印象挑一个“更简单”的模型。
形式定义 ​
给定惩罚泛函
约束形式
直觉
正则项为复杂行为标出价格,
例子与边界
岭回归例子 ​
在赋范向量空间中的线性回归里,令
当特征高度共线时,二次惩罚抑制大范数方向并改善条件性;在统计解释中,它也限制可选线性函数的有效范围。两种作用相关,却不是同一个结论:数值上更稳定不自动证明总体风险更低。
推导出的权衡 ​
与类内最优
右侧显示正则器允许牺牲拟合以换取较小惩罚。最终是否有利,要把这项与由范数、稳定性或复杂度得到的泛化界共同分析;仅看正则化目标值不能完成论证。
边界与相邻概念 ​
参数范数依赖表示。两层线性网络可通过一层乘常数、另一层除常数保持同一函数,却改变单层参数范数,所以“参数小”不总等于“函数类简单”。
本页处理一个连续目标中的惩罚;结构风险最小化则在可数模型层之间分配置信度并选择层级。二者可以组合,但不能把任意超参数搜索都称为 SRM。
推论与应用
强凸正则化常把单点目标扰动转成小的参数变化,再由 Lipschitz 损失推出算法稳定性泛化界。范数约束也可进入 Rademacher 或 margin 复杂度,使正则参数同时影响逼近误差与估计误差。
岭回归、稀疏回归与核方法都可写成这一模板,但惩罚的几何必须与函数表示相匹配。若
参考资料
- Andrey N. Tikhonov, Solution of Incorrectly Formulated Problems and the Regularization Method, 1963.
- Olivier Bousquet, André Elisseeff, Stability and Generalization, JMLR, 2002.