““fast rate”也不是优化收敛更快。它描述样本数增加时的统计超额风险,而非梯度法迭代次数。优化误差若大于 $r^ $,会遮住局部统计收益,必须在近似 ERM 分解中另行保留。”
基准与恒等式 ​
固定分布、损失和类
下确界未必达到,故不应未经条件指定“类内最优参数”。
若
泛化项出现两次,分别控制输出与比较规则;优化误差按目标值定义,参数距离或梯度范数需额外条件才能转换。
三种失败的图像 ​
真实边界是圆而
训练—测试差只比较同一规则的两种风险,不是超额风险。非唯一最优时,参数相距很远也可能风险相同。正则化和代理损失会引入新的比较项,每次都应写清基准,不能把全部余量统称为“泛化误差”。
例如某任务的 Bayes 风险为
分解还能指导改进顺序:当逼近项主导时,多采同分布数据不会突破类的天花板;当估计项主导时,盲目扩大类可能更糟;当优化项已远小于统计精度,再把训练目标多降十位小数通常不改变可保证的总体风险。这里的判断基于同一风险尺度,而不是把参数误差、运行时间和分类错误直接相加。
代理损失会增加一层转换。算法也许最小化 logistic 风险,但最终报告 0–1 风险;先分解代理风险的逼近、估计和优化项,再用校准函数把代理超额风险转换成分类超额风险。没有这条转换,代理目标下降不等于任务风险按同样数值下降。
若类或正则参数由同一数据选择,
参考资料
- Devroye, Györfi, Lugosi, A Probabilistic Theory of Pattern Recognition, 1996.
- Shalev-Shwartz, Ben-David, Understanding Machine Learning, 2014.