“本页处理一个连续目标中的惩罚;结构风险最小化则在可数模型层之间分配置信度并选择层级。二者可以组合,但不能把任意超参数搜索都称为 SRM。”
形式陈述 ​
模型层越大,训练误差通常越小,估计误差却越难控制。SRM 不先固定某一层再做ERM,而是为每层的统计不确定性开出一张“复杂度账单”,然后比较经验风险与账单之和。
形式框架 ​
设
则并集界保证所有层的陈述以至少
直觉
SRM 像让不同容量的模型在同一张价目表上竞价:更大的类可以用更低训练误差参赛,却必须支付更高的统计不确定性。置信预算先保证所有层的账单同时有效,随后数据才能安全选择最划算的一层。
Oracle 不等式怎样出现 ​
在上述共同事件上,对任意层
再对
例子与边界
多项式次数例子 ​
用次数不超过
边界与辨析 ​
SRM 不是任意交叉验证或超参数调优的同义词。它的定义包含一族类、每层风险控制和跨层共同事件;没有这三项,就没有上面的 oracle 推导。模型族不必严格嵌套,但可数索引与可求和置信分配仍需明确。与正则化 ERM相比,SRM 的罚项来自层级置信界,而连续正则器直接改变每个候选的训练目标。
推论与应用
样本复杂度为每一层提供随
次数、树深、稀疏度和范数半径都可作为层级索引。应用时应给出每层真正可证的复杂度,而不是只把超参数大小当作罚项;若索引连续,还需离散化、先验权重或另一种统一控制。
参考资料
- Vladimir Vapnik, Statistical Learning Theory, Wiley, 1998.
- Mehryar Mohri, Afshin Rostamizadeh, Ameet Talwalkar, Foundations of Machine Learning, 2nd ed., MIT Press, 2018.