Skip to content

定义Definition

概率校准与可靠度

Probability calibration · Reliability diagram

用条件正例率等于报告概率定义概率校准,计算可靠度与分箱误差,并区分校准、边际均值、分类一致性和分辨力。

形式陈述 ​

一个预测器每次给出 S∈[0,1],表示二元结果 Y∈{0,1} 为正的概率。概率校准要求

E[Y∣S]=S几乎处处.

这里的条件期望按预测器自己的报告分组。若某个分数 s 有正概率,上式就是

Pr(Y=1∣S=s)=s.

连续分数通常满足 Pr(S=s)=0,不能把这个条件概率当成“用一个零概率事件作分母”。应使用条件期望的版本,其等式只需对 S 的分布几乎处处成立。

记 m(S)=E[Y∣S]。一种总体校准误差为

CE1=E|m(S)−S|,

它等于零当且仅当预测器校准。平方版本 E(m(S)−S)2 则是 Brier 分解中的可靠度损失。

实际评估不能直接知道 m。对 n≥1 个观测,预先将 [0,1] 划成有限个互不相交的可测箱 B1,…,BM,在有样本的箱中计算

s¯j=1nj∑i:Si∈BjSi,y¯j=1nj∑i:Si∈BjYi,ECE^=∑j:nj>0njn|y¯j−s¯j|.

可靠度图把 (s¯j,y¯j) 与对角线比较,并应同时显示每箱样本量。这个二分类版本评估的是“正类概率”;多类任务中常见的“最高置信度是否等于预测正确率”是另一个条件事件,不能直接互换。[1, §2]

直觉

设长期预报中有一批日子都被报成 0.7 的降雨概率。校准要求这批日子约有七成下雨。它没有要求这些日子各自真实的条件概率都恰好为 0.7:有的可能更高,有的更低,只要在该报告档内平均匹配即可。

因此校准的分组尺度由报告决定。若一个模型永远只说 0.4,而总体确有四成正例,它完全校准;但它把所有样本放在同一档,毫无区分能力。校准与是否利用了有价值的特征,是两个需要分别检查的问题。

例子与边界

分类准确率相同,概率含义不同 ​

令两类输入各占一半,真实正例率分别为 0.2 和 0.8。预测器甲分别报 0.2,0.8;预测器乙分别报 0.05,0.95。两者以 1/2 为阈值时,都在第一类预测负、第二类预测正,准确率都是 0.8。

甲满足每档真实频率等于报告。乙则在低档高估“不会发生”的把握,在高档高估“会发生”的把握:其两个绝对偏差均为 0.15,所以 CE1=0.15。只看分类错误率无法发现这一区别。

分类代理损失的校准保证的是总体最优打分指向正确分类方向。它没有声称训练后输出的每个数值已能作为可靠概率使用。

分箱可以把偏差互相抵消 ​

再令 S 等概率取 0.2 和 0.4,相应真实正例率却是 0.4 和 0.2。逐分数校准误差为 0.2。若把两个分数塞进同一个箱,箱内平均报告和正例率都是 0.3,总体分箱误差却为零。

一般地,按全期望,总体分箱版误差为

∑jPr(S∈Bj)|E[m(S)−S∣S∈Bj]|≤E|m(S)−S|.

箱内先平均再取绝对值,会掩盖方向相反的误差;这是分辨率问题。有限样本又增加另一层随机波动:即便真实校准,经验正例率通常也不恰等于报告,所以经验 ECE 也未必为零。增加箱数降低了粗分组的掩盖,却使每箱数据更少。

平均概率正确仍然不够 ​

校准必推出 ES=EY,但反向不成立。上一例恰好同时具有均值 0.3,仍不校准。更细的群体中也可能失准:若两群体各占一半,正例率分别为 0.2,0.8,常报 0.5 在总体校准,在任一群体内部却都不校准。

群体内校准要求 E[Y∣S,A]=S,条件中额外保留群体标记 A。这是更强的要求,见多重校准。用条件概率写指标时,应先固定究竟保留了哪些信息,而不是只写一句“模型已经校准”。

推论与应用

若知道真实校准函数 m(s)=E[Y∣S=s],把报告改成 T=m(S),则

E[Y∣T]=E[E[Y∣S]∣T]=E[T∣T]=T.

第二步因为 T 是 S 的函数。这证明总体校准可以通过后处理恢复;它没有让人凭有限数据免费知道 m。保序校准约束后处理单调,温度缩放进一步只调一个参数,两者的估计误差和表达能力都需单独判断。

校准保证还依赖评估分布。训练期与使用期的标签机制或基率改变时,旧可靠度图不能自动延续。一个可操作的报告应注明数据来源、分箱、各箱质量、是否用独立样本评估,并把校准误差与总体预测质量同时呈现。

参考资料
关系图谱12 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系