“本页处理一个连续目标中的惩罚;结构风险最小化则在可数模型层之间分配置信度并选择层级。二者可以组合,但不能把任意超参数搜索都称为 SRM。”
概念图像 ​
模型层越大,训练误差通常越小,估计误差却越难控制。SRM 不先固定某一层再做 ERM,而是为每层的统计不确定性开出一张“复杂度账单”,然后比较经验风险与账单之和。
形式框架 ​
设
则并集界保证所有层的陈述以至少
Oracle 不等式怎样出现 ​
在上述共同事件上,对任意层
再对
多项式次数例子 ​
用次数不超过
边界与辨析 ​
SRM 不是任意交叉验证或超参数调优的同义词。它的定义包含一族类、每层风险控制和跨层共同事件;没有这三项,就没有上面的 oracle 推导。模型族不必严格嵌套,但可数索引与可求和置信分配仍需明确。与正则化 ERM相比,SRM 的罚项来自层级置信界,而连续正则器直接改变每个候选的训练目标。
参考资料
- Vladimir Vapnik, Statistical Learning Theory, Wiley, 1998.
- Mehryar Mohri, Afshin Rostamizadeh, Ameet Talwalkar, Foundations of Machine Learning, 2nd ed., MIT Press, 2018.