“本页是逐坐标的标量定理。向量值映射、多个输出坐标共享非线性、谱范数控制的网络层需要向量收缩或专门的链式界,不能把 $L$ 机械乘上去。引理也只控制复杂度,不判断代理损失是否分类校准;后者属于…”
为什么需要代理损失 ​
二分类的
条件风险与定义 ​
令
在固定
若对每个
Logistic 损失的计算 ​
取
因此
从代理超额风险到分类风险 ​
校准可量化为存在非减函数
于是代理超额风险趋零可推出分类超额风险趋零。具体
边界与相邻概念 ​
分类校准关心最优决策的符号,概率校准关心预测概率与条件频率是否一致,两者不是一回事。类别不平衡、代价敏感分类或 F-score 等非可分指标改变 Bayes 决策阈值,需要相应的条件风险定义。Hinge loss 对分类是校准的,但其最优 score 不提供唯一概率;交叉熵的 log-loss 结构也不能替代这里的超额风险论证。AdaBoost 的指数损失则在AdaBoost页承担具体算法角色。
参考资料
- Peter L. Bartlett, Michael I. Jordan, Jon D. McAuliffe, Convexity, Classification, and Risk Bounds, JASA, 2006.
- Ingo Steinwart, How to Compare Different Loss Functions and Their Risks, Constructive Approximation, 2007.