“本页是逐坐标的标量定理。向量值映射、多个输出坐标共享非线性、谱范数控制的网络层需要向量收缩或专门的链式界,不能把 $L$ 机械乘上去。引理也只控制复杂度,不判断代理损失是否分类校准;后者属于…”
形式陈述 ​
本页从分类风险出发,以凸代理逼近难优化的
二分类的
条件风险与定义 ​
令
在固定
若对每个
直觉
Logistic 损失的计算 ​
取
因此
例子与边界
从代理超额风险到分类风险 ​
校准可量化为存在非减函数
于是代理超额风险趋零可推出分类超额风险趋零。具体
边界与相邻概念 ​
分类校准关心最优决策的符号,概率校准关心预测概率与条件频率是否一致,两者不是一回事。类别不平衡、代价敏感分类或 F-score 等非可分指标改变 Bayes 决策阈值,需要相应的条件风险定义。Hinge loss 对分类是校准的,但其最优 score 不提供唯一概率;交叉熵的 log-loss 结构也不能替代这里的超额风险论证。AdaBoost 的指数损失则在AdaBoost页承担具体算法角色。
推论与应用
校准函数把“优化代理目标”与“降低任务错误”连接起来;再叠加代理损失类的泛化界和优化误差,便得到从训练算法到
logistic、hinge 与 exponential 损失分别服务概率建模、最大间隔和 boosting,但它们的校准函数、尾部和优化几何不同。代价敏感或多类任务必须重新写条件风险,不能沿用二分类阈值结论。
参考资料
- Peter L. Bartlett, Michael I. Jordan, Jon D. McAuliffe, Convexity, Classification, and Risk Bounds, JASA, 2006.
- Ingo Steinwart, How to Compare Different Loss Functions and Their Risks, Constructive Approximation, 2007.