“本分解适合定位改进方向:数值偏离真实频率时,校准后处理可能减少可靠度损失;所有档真实风险几乎相同时,需要更有信息的预测依据。单独压低经验校准误差,不能代替对独立数据上总体预测质量的检查。”
形式陈述
一个已经训练好的分类器输出分数
固定原分类器后,给定
第
这是带单调约束的经验风险最小化。正权重使目标连续、严格凸,并随
给未在校准集中出现的分数预测时,还须选定延拓方式,例如相邻已拟合分数之间采用右连续阶梯、两端延用端点值。式 (1) 只确定观测分数处的值,不唯一决定空隙中的整条函数。
直觉
某一低分档的经验正例率高于后一高分档时,单独照抄这两个频率会破坏排序假设。保序拟合把这两档暂时视为同一概率层,合并其样本并取平均。如果合并后的新层又低于左边一层,就继续向左合并。
它不强迫概率随分数严格上升:一些相邻分数可以被压到同一平台。平台意味着校准数据不足以在单调限制下把这些档可靠地区分,而不是证明它们的真实风险必然完全相等。
例子与边界
相邻违反块合并如何执行
PAV 算法维护一个从左到右的块栈。每块保存起止位置、总权重
- 读入下一档,把它作为单点块压栈
- 若栈顶左块均值大于右块均值,弹出两块,合并其
后重新压栈 - 重复第 2 步,直到栈上相邻均值不再下降,再处理下一档
- 全部读完后,把每块均值赋给块内所有位置
等权例子按分数顺序取标签
前两点形成均值
式 (1) 不计
直接保留原标签的损失虽为零,却不是可行的非降序列;把所有点报成总体均值
为什么合并结果是全局最优
仅说“违反就平均”还不足以证明最优。PAV 的一个关键不变量是:对每个最终块
单点块满足它。合并均值
令
各块总残差为零,式 (2) 给出
对任意非降可行序列
最后一步利用分部求和,以及
时间成本与统计边界
每个输入块压栈一次,每次合并把块数减少一。合并最多
这个保证是对当前校准集的最优拟合。它不是总体概率校准的有限样本保证。小数据可产生大量不稳定平台,端点全零或全一还可能给新样本带来很大对数损失。额外平滑、裁剪或正则化可以另作设计,但会改变这里精确求解的问题。
推论与应用
保序映射保留弱排序,却可能制造平票。它通常比单参数温度缩放灵活,也需要更多数据支撑这份灵活性。如果原分数对真实风险的排序本来就错,任何非降后处理都无法任意颠倒它。
应按照数据角色分离先训练原模型,再拟合校准映射,最后用未参与这两步的数据评价。不能让原模型在同一批样本上先过拟合出极端分数,再把那些训练标签拿来证明校准有效。
参考资料
- [1] Bianca Zadrozny and Charles Elkan, Transforming Classifier Scores into Accurate Multiclass Probability Estimates, KDD 2002,§3:保序校准与 PAV。本文使用加权块栈,并给出前缀残差不变量和完整最优性证书。
- [2] Chuan Guo et al., On Calibration of Modern Neural Networks, 2017,§4.1:保序平方拟合与校准集上的后处理。