Skip to content

定义Definition

适当评分规则

Proper scoring rule · Strictly proper scoring rule

以真实分布为总体期望损失的最优报告,区分适当与严格适当评分,并由凹熵的支撑线构造二元概率损失。

形式陈述 ​

一次预报给出“明天下雨的概率是 q”,随后只观察到下雨或不下雨。怎样评价这个概率,而不是只评价最后猜中了哪一类?

设结果集合为有限集 Y={1,…,k},其中 k≥1。真实概率分布为 p=(p1,…,pk),报告分布为 q。评分损失 ℓ(q,y) 的总体风险是

L(p,q)=∑y=1kpyℓ(q,y).

本文约定损失越小越好。若对允许的全部 p,q 都有

L(p,p)≤L(p,q),

则称 ℓ 为适当评分规则;若取等当且仅当 q=p,则称严格适当。有些文献把分数定义为越大越好的奖励,取负号即可转换,不能把两种不等式方向混用。[1, §§2–3]

这里“真实报告最优”指重复面对同一真实分布时的期望。一次没有下雨,不会证明预报 q=0.8 错了;一次实现结果也不能直接检验严格适当性。

二元情形写 Y∈{0,1},p=Pr(Y=1),报告只需一个 q∈[0,1]。两个典型严格适当损失是

ℓB(q,y)=(q−y)2,ℓlog(q,y)=−ylog⁡q−(1−y)log⁡(1−q).

对数取自然底。对数损失采用标准延拓:给实际发生的事件报零概率会产生 +∞;零概率事件对期望的贡献按极限解释为零。

直觉

只按分类正确率打分,会鼓励报告者站在阈值的正确一侧,却不在乎他报 0.6 还是 0.99。概率评分还要区分这两种置信程度。它需要同时惩罚“明明很不确定却说得很满”和“已经有充分信息却含糊报告”。

适当性不是要求每次都押中结果,而是确保:如果报告者认为真实分布为 p,他无法靠故意改报另一个 q 降低自己的期望损失。严格性进一步排除所有同样划算的虚假报告。

图中两种损失使用同一真实分布。曲线的最低点是否落在 p,比某次实现结果的高低更能说明评分规则究竟在奖励什么。

例子与边界

平方损失的最优报告 ​

直接展开得

LB(p,q)=p(1−q)2+(1−p)q2=p(1−p)+(q−p)2.

第一项不随报告变化,第二项在且仅在 q=p 为零,因此严格适当。真实概率为 p=1/4 时,诚实报告的期望损失是 3/16;改报 q=0 得 1/4,改报 q=1/2 也得 1/4。两种方向不同的误报恰好有相同的平方偏差。

对数损失则满足

Llog(p,q)−Llog(p,p)=plog⁡pq+(1−p)log⁡1−p1−q.

右边是 Bernoulli 分布间以自然对数计量的KL 散度。它非负,且只在两分布相同为零。若 0<p<1 而 q 报成 0 或 1,期望损失无穷,体现了对错误绝对确信的强惩罚。

一个看似合理却不适当的评分 ​

把二元结果和概率之间的绝对差当损失,得到

E|q−Y|=p(1−q)+(1−p)q=p+(1−2p)q.

当 p=1/4 时,它等于 1/4+q/2,最优报告是 q=0,不是 1/4。绝对损失适合估计中位数;把它用于报告完整 Bernoulli 概率,就会奖励把概率推向多数类别的端点。

“适当但不严格”也有意义。例如先用 q≥1/2 选类别,再计分类错误。真实 p>1/2 时,全部 q≥1/2 都达到相同最优风险,包括 q=p。诚实报告最优,却并不唯一;这个评分无法辨别多数一侧的不同概率。

一个构造机制:凹熵的支撑线 ​

在二元概率区间内部,取可微的凹函数 H,定义

ℓH(q,y)=H(q)+(y−q)H′(q).

对 Y∼Bernoulli(p) 求期望,

LH(p,q)=H(q)+(p−q)H′(q)≥H(p)=LH(p,p).

不等式来自凹函数的切线位于函数图像上方,也就是凸函数支撑不等式取负号后的形式。若 H 严格凹,不同点之间严格不等,规则便严格适当。这个论证适用于有有限导数的内部点;边界需要逐项检查连续延拓或无穷损失,不能默认为可微。

取 H(p)=p(1−p),得到的正是 Brier 损失;取 H(p)=−plog⁡p−(1−p)log⁡(1−p),得到对数损失。评分规则背后的曲率,决定了不同方向和幅度的概率误报受到多少惩罚。

推论与应用

若特征为 X,且可以在全部可测概率预测器中选择,那么严格适当损失的逐点总体最优解是 q(X)=Pr(Y=1∣X)。这不保证有限数据训练出的模型已经最优,也不保证受限函数类能表示这个条件概率。

概率校准问的是预测器给出的每个概率档是否与实际频率一致;适当性问的是评价规则是否鼓励正确报告。一个严格适当的训练目标与一个尚未校准的训练结果可以同时存在。比较两个模型时,还应使用同一评估分布:换了更容易预测的样本,损失下降未必来自模型改进。

Brier 损失的平方结构还能把总体分数进一步拆成可靠度、分辨力和基率波动,见Brier 分数分解。这个分解解释了为什么“总报基率”的模型可以完全校准,却仍输给能区分不同情形的模型。

参考资料
关系图谱11 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系