Skip to content

分类代理损失与校准

classification calibration · classification surrogate loss

说明可优化代理风险在什么条件下能够控制二分类的零一超额风险。

为什么需要代理损失

二分类的 01 损失直接对应误分类率,却对实值打分函数既不光滑也不凸。训练常改用 logistic、exponential 或 hinge 损失。代理损失的计算便利只回答“能否优化”,校准则回答“把代理风险降下来,方向是否真的朝向 Bayes 分类器”。

条件风险与定义

Y{1,+1},打分函数 f:XRsignf(x) 分类,margin 型代理风险为

Rϕ(f)=Eϕ(Yf(X)).

在固定 X=xη(x)=Pr(Y=1X=x) 时,条件代理风险是

Cη(a)=ηϕ(a)+(1η)ϕ(a).

若对每个 η1/2,所有达到条件最优的 score 都与 2η1 同号,并且强迫错误符号会造成严格正的风险间隙,就称该代理对二分类是 classification-calibrated;这也是常见 Fisher consistency 的条件形式。

Logistic 损失的计算

ϕ(u)=log(1+eu)。对 Cη(a) 求导并令零,可得

a=logη1η.

因此 a>0 当且仅当 η>1/2,最优 score 的符号与 Bayes 决策一致。这个结论解释了分类一致性;它不等于说有限样本训练出的 sigmoid 数值必然是校准概率。

从代理超额风险到分类风险

校准可量化为存在非减函数 ψ,满足 ψ(0)=0 且对正数为正,使

ψ(R01(signf)R01)Rϕ(f)Rϕ.

于是代理超额风险趋零可推出分类超额风险趋零。具体 ψ 由损失决定;不能只凭“ϕ 是凸函数”就断言存在合适校准。

边界与相邻概念

分类校准关心最优决策的符号,概率校准关心预测概率与条件频率是否一致,两者不是一回事。类别不平衡、代价敏感分类或 F-score 等非可分指标改变 Bayes 决策阈值,需要相应的条件风险定义。Hinge loss 对分类是校准的,但其最优 score 不提供唯一概率;交叉熵的 log-loss 结构也不能替代这里的超额风险论证。AdaBoost 的指数损失则在AdaBoost页承担具体算法角色。

参考资料