形式陈述
一次预报给出“明天下雨的概率是 ”,随后只观察到下雨或不下雨。怎样评价这个概率,而不是只评价最后猜中了哪一类?
设结果集合为有限集 ,其中 。真实概率分布公理库概率分布Probability distribution · Law可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。为 ,报告分布为 。评分损失 的总体风险公理库损失函数与总体风险Loss function · Population risk · Expected risk损失刻画一次决策的代价,总体风险是未知分布下的平均代价。是
本文约定损失越小越好。若对允许的全部 都有
则称 为适当评分规则;若取等当且仅当 ,则称严格适当。有些文献把分数定义为越大越好的奖励,取负号即可转换,不能把两种不等式方向混用。[1, §§2–3]
这里“真实报告最优”指重复面对同一真实分布时的期望。一次没有下雨,不会证明预报 错了;一次实现结果也不能直接检验严格适当性。
二元情形写 ,,报告只需一个 。两个典型严格适当损失是
对数取自然底。对数损失采用标准延拓:给实际发生的事件报零概率会产生 ;零概率事件对期望的贡献按极限解释为零。
直觉
只按分类正确率打分,会鼓励报告者站在阈值的正确一侧,却不在乎他报 还是 。概率评分还要区分这两种置信程度。它需要同时惩罚“明明很不确定却说得很满”和“已经有充分信息却含糊报告”。
适当性不是要求每次都押中结果,而是确保:如果报告者认为真实分布为 ,他无法靠故意改报另一个 降低自己的期望损失。严格性进一步排除所有同样划算的虚假报告。
图中两种损失使用同一真实分布。曲线的最低点是否落在 ,比某次实现结果的高低更能说明评分规则究竟在奖励什么。
例子与边界
平方损失的最优报告
直接展开得
第一项不随报告变化,第二项在且仅在 为零,因此严格适当。真实概率为 时,诚实报告的期望损失是 ;改报 得 ,改报 也得 。两种方向不同的误报恰好有相同的平方偏差。
对数损失则满足
右边是 Bernoulli 分布间以自然对数计量的KL 散度公理库KL 散度Kullback–Leibler divergence · Relative entropy同一可测空间上分布 P 相对于 Q 的对数 Radon–Nikodym 导数在 P 下的积分。。它非负,且只在两分布相同为零。若 而 报成 或 ,期望损失无穷,体现了对错误绝对确信的强惩罚。
一个看似合理却不适当的评分
把二元结果和概率之间的绝对差当损失,得到
当 时,它等于 ,最优报告是 ,不是 。绝对损失适合估计中位数;把它用于报告完整 Bernoulli 概率,就会奖励把概率推向多数类别的端点。
“适当但不严格”也有意义。例如先用 选类别,再计分类错误。真实 时,全部 都达到相同最优风险,包括 。诚实报告最优,却并不唯一;这个评分无法辨别多数一侧的不同概率。
一个构造机制:凹熵的支撑线
在二元概率区间内部,取可微的凹函数 ,定义
对 求期望,
不等式来自凹函数的切线位于函数图像上方,也就是凸函数支撑不等式公理库凸函数Convex function函数在任意凸组合处不超过相同权重下函数值的凸组合。取负号后的形式。若 严格凹,不同点之间严格不等,规则便严格适当。这个论证适用于有有限导数的内部点;边界需要逐项检查连续延拓或无穷损失,不能默认为可微。
取 ,得到的正是 Brier 损失;取 ,得到对数损失。评分规则背后的曲率,决定了不同方向和幅度的概率误报受到多少惩罚。
推论与应用
若特征为 ,且可以在全部可测概率预测器中选择,那么严格适当损失的逐点总体最优解是 。这不保证有限数据训练出的模型已经最优,也不保证受限函数类能表示这个条件概率。
概率校准公理库概率校准与可靠度Probability calibration · Reliability diagram用条件正例率等于报告概率定义概率校准,计算可靠度与分箱误差,并区分校准、边际均值、分类一致性和分辨力。问的是预测器给出的每个概率档是否与实际频率一致;适当性问的是评价规则是否鼓励正确报告。一个严格适当的训练目标与一个尚未校准的训练结果可以同时存在。比较两个模型时,还应使用同一评估分布:换了更容易预测的样本,损失下降未必来自模型改进。
Brier 损失的平方结构还能把总体分数进一步拆成可靠度、分辨力和基率波动,见Brier 分数分解公理库Brier 分数的可靠度—分辨力分解Brier score decomposition · Murphy decomposition把二元概率平方误差严格分为可靠度损失减分辨力加基率不确定性,并逐项算出校准修正和无信息预报的差别。。这个分解解释了为什么“总报基率”的模型可以完全校准,却仍输给能区分不同情形的模型。
参考资料