“线性规划、组合优化和统计经验准则都可实例化这套接口,但各自的结构与信息协议必须另行声明。特别是精确求出经验目标,并不自动控制未知分布上的总体风险;后者还包含统计学习问题的抽样层。”
选择原则 ​
给定样本
经验风险最小化(ERM)要求学习器选择
它规定在什么准则下选择预测器,不规定怎样计算。枚举、排序或凸优化都可能实现同一原则;算法名称、参数表示和 ERM 定义不是同一层。
若最小值没有达到,或计算预算只允许近似求解,应明确使用加性近似 ERM:
多解时还须有可测 tie-breaking,才能把
阈值扫描:原则与实现闭环 ​
对实线阈值类,按
样本
何时能泛化 ​
ERM 只保证训练平均不高。要把这一选择转成总体风险保证,需要同时控制整个假设类上的经验风险与总体风险;只对每个预先固定的
取所有二元函数作为
存在性与计算边界 ​
ERM 可能不存在。若
经验目标的加性次优是最直接的优化接口。乘法近似在最优经验风险可能为零时没有稳定含义,参数距离也会因重参数化而改变;“梯度很小”只有结合曲率或全局证书时,才能推出经验目标接近最优。统计保证应使用真正得到证明的优化量。
正则化 ERM 最小化
把假设类换成参数空间、把经验预测损失换成一般随机准则,就得到更宽的M-估计框架。这个包含关系有助于迁移 argmin 和近似选择语言,但理解 ERM 不需要先掌握 M-估计的一致性或渐近理论。
参考资料
- Vladimir Vapnik, Statistical Learning Theory, 1998.
- Shalev-Shwartz, Ben-David, Understanding Machine Learning, Ch. 4.