“没有正则器的 FTL 可在线性 regret:在区间上令线性损失梯度交替并刻意使历史和在零附近翻转,leader 会不断选到下一轮不利端点。argmin 的存在和计算效率也不是 regret…”
概念图像 ​
纯 ERM 只问哪一个候选在样本上犯错最少;正则化 ERM 同时问,为换取这点拟合改善付出了多复杂的规则。它把两种代价写进同一个目标,而不是在训练结束后凭印象挑一个“更简单”的模型。
形式定义 ​
给定惩罚泛函
约束形式
岭回归例子 ​
在线性回归中,令
当特征高度共线时,二次惩罚抑制大范数方向并改善条件性;在统计解释中,它也限制可选线性函数的有效范围。两种作用相关,却不是同一个结论:数值上更稳定不自动证明总体风险更低。
推导出的权衡 ​
与类内最优
右侧显示正则器允许牺牲拟合以换取较小惩罚。最终是否有利,要把这项与由范数、稳定性或复杂度得到的泛化界共同分析;仅看正则化目标值不能完成论证。
边界与相邻概念 ​
参数范数依赖表示。两层线性网络可通过一层乘常数、另一层除常数保持同一函数,却改变单层参数范数,所以“参数小”不总等于“函数类简单”。
本页处理一个连续目标中的惩罚;结构风险最小化则在可数模型层之间分配置信度并选择层级。二者可以组合,但不能把任意超参数搜索都称为 SRM。
参考资料
- Andrey N. Tikhonov, Solution of Incorrectly Formulated Problems and the Regularization Method, 1963.
- Olivier Bousquet, André Elisseeff, Stability and Generalization, JMLR, 2002.