Skip to content

结构风险最小化

structural risk minimization · SRM

在嵌套或可数假设类之间用置信惩罚选择模型,并与各层最佳风险竞争。

概念图像

模型层越大,训练误差通常越小,估计误差却越难控制。SRM 不先固定某一层再做 ERM,而是为每层的统计不确定性开出一张“复杂度账单”,然后比较经验风险与账单之和。

形式框架

H1H2,并选择 δk>0 使 kδkδ。若对第 k 层,以概率至少 1δk

suphHk|R(h)R^S(h)|penk(m,δk),

并集界保证所有层的陈述以至少 1δ 同时成立。SRM 选择

(k^,h^)argmink,,hHk{R^S(h)+penk(m,δk)}.

Oracle 不等式怎样出现

在上述共同事件上,对任意层 k 的经验最优解 h^k,有

R(h^)R^S(h^)+penk^R^S(h^k)+penkinfhHkR(h)+2penk.

再对 k 取下确界,便得到与“事后知道最佳层”的 oracle 比较。常数会随单边界和选取准则变化,核心结构是逼近风险加层级惩罚。

多项式次数例子

用次数不超过 k 的多项式回归时,训练误差随 k 增大而不升。若只选训练误差最小者,最大层天然占优;SRM 的惩罚随维度或增长函数上升,使低阶模型在其拟合已经足够时胜出。这里不是把 k 叫作“复杂度”就结束,必须给每层可证明的高概率罚项,并给可数层分配 δk,例如与 1/k2 成比例。

边界与辨析

SRM 不是任意交叉验证或超参数调优的同义词。它的定义包含一族类、每层风险控制和跨层共同事件;没有这三项,就没有上面的 oracle 推导。模型族不必严格嵌套,但可数索引与可求和置信分配仍需明确。与正则化 ERM相比,SRM 的罚项来自层级置信界,而连续正则器直接改变每个候选的训练目标。

参考资料
  • Vladimir Vapnik, Statistical Learning Theory, Wiley, 1998.
  • Mehryar Mohri, Afshin Rostamizadeh, Ameet Talwalkar, Foundations of Machine Learning, 2nd ed., MIT Press, 2018.