Skip to content

结构风险最小化

structural risk minimization · SRM

在嵌套或可数假设类之间用置信惩罚选择模型,并与各层最佳风险竞争。

条目类型
原则

形式陈述

模型层越大,训练误差通常越小,估计误差却越难控制。SRM 不先固定某一层再做ERM,而是为每层的统计不确定性开出一张“复杂度账单”,然后比较经验风险与账单之和。

形式框架

H1H2,并选择 δk>0 使 kδkδ。若对第 k 层,以概率至少 1δk

suphHk|R(h)R^S(h)|penk(m,δk),

并集界保证所有层的陈述以至少 1δ 同时成立。SRM 选择

(k^,h^)argmink, hHk{R^S(h)+penk(m,δk)}.
直觉

SRM 像让不同容量的模型在同一张价目表上竞价:更大的类可以用更低训练误差参赛,却必须支付更高的统计不确定性。置信预算先保证所有层的账单同时有效,随后数据才能安全选择最划算的一层。

Oracle 不等式怎样出现

在上述共同事件上,对任意层 k 的经验最优解 h^k,有

R(h^)R^S(h^)+penk^R^S(h^k)+penkinfhHkR(h)+2penk.

再对 k 取下确界,便得到与“事后知道最佳层”的 oracle 比较。常数会随单边界和选取准则变化,核心结构是逼近风险加层级惩罚。

例子与边界

多项式次数例子

用次数不超过 k 的多项式回归时,训练误差随 k 增大而不升。若只选训练误差最小者,最大层天然占优;SRM 的惩罚随维度或增长函数上升,使低阶模型在其拟合已经足够时胜出。这里不是把 k 叫作“复杂度”就结束,必须给每层可证明的高概率罚项,并给可数层分配 δk,例如与 1/k2 成比例。

边界与辨析

SRM 不是任意交叉验证或超参数调优的同义词。它的定义包含一族类、每层风险控制和跨层共同事件;没有这三项,就没有上面的 oracle 推导。模型族不必严格嵌套,但可数索引与可求和置信分配仍需明确。与正则化 ERM相比,SRM 的罚项来自层级置信界,而连续正则器直接改变每个候选的训练目标。

推论与应用

样本复杂度为每一层提供随 m 缩小的罚项,并集界则把层级选择纳入同一个失败概率。由此得到的 oracle 不等式允许算法在不知道最佳模型规模时,与事后最优的逼近—估计折中竞争。

次数、树深、稀疏度和范数半径都可作为层级索引。应用时应给出每层真正可证的复杂度,而不是只把超参数大小当作罚项;若索引连续,还需离散化、先验权重或另一种统一控制。

参考资料
  • Vladimir Vapnik, Statistical Learning Theory, Wiley, 1998.
  • Mehryar Mohri, Afshin Rostamizadeh, Ameet Talwalkar, Foundations of Machine Learning, 2nd ed., MIT Press, 2018.
关系图谱7 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系