Skip to content

定理Theorem

Brier 分数的可靠度—分辨力分解

Brier score decomposition · Murphy decomposition

把二元概率平方误差严格分为可靠度损失减分辨力加基率不确定性,并逐项算出校准修正和无信息预报的差别。

形式陈述 ​

令 Y∈{0,1},报告概率为 S∈[0,1],总体正例率为 π=EY,且

m(S)=E[Y∣S].

二元 Brier 分数采用

BS=E(S−Y)2

这一归一化;若把两类完整概率向量与 one-hot 向量的平方差相加,数值会是本文的两倍。

定义三个非负量:

REL=E(S−m(S))2,RES=E(m(S)−π)2,UNC=π(1−π).

则有可靠度—分辨力分解

BS=REL−RES+UNC.

可靠度项衡量概率校准偏差,越小越好;分辨力项衡量不同报告档的真实风险相差多少,越大越好;不确定性项是总体 Bernoulli 结果本身的方差。三个量均非负,但分辨力在恒等式中被减去。[1,3]

直觉

从“所有情况都报总体正例率”出发,基线平方误差就是 π(1−π)。有用的预测器把样本分成真实风险不同的档位,因此减少了箱内还剩的随机性;这份收益是分辨力。若档位虽有用,报出的数值却偏离档内真实频率,又会付出可靠度损失。

这个顺序解释了一个常见误会:完全校准不代表已经没有改进空间。常报基率的预测器可靠度项为零,分辨力也为零;能可靠地区分高低风险的模型,可以在仍然校准的同时获得更低 Brier 分数。

例子与边界

一份可以逐格验算的预报 ​

令两种报告等概率出现:S=0.2 时真实正例率为 0.1,S=0.8 时为 0.7。因此

π=12(0.1+0.7)=0.4,UNC=0.4×0.6=0.24.

两档都高报了 0.1,所以

REL=12(0.2−0.1)2+12(0.8−0.7)2=0.01.

真实风险分别离基率 0.3,故

RES=12(0.1−0.4)2+12(0.7−0.4)2=0.09.

分解给出 BS=0.01−0.09+0.24=0.16。也可直接按标签求平均:

BS=12[0.1(1−0.2)2+0.9(0.2)2]+12[0.7(1−0.8)2+0.3(0.8)2]=12(0.10+0.22)=0.16.

若把两档改报成正确的 0.1,0.7,分辨力不变,可靠度损失降为零,分数变成 0.15。若索性只报 0.4,虽然也校准,却失去全部分辨力,分数回到 0.24。

分解为什么成立 ​

写 S−Y=(S−m)+(m−Y) 并平方。给定 S 后,S−m 是确定量,而 E[m−Y∣S]=0,交叉项消失。因此

E(S−Y)2=E(S−m)2+EVar(Y∣S).

再用全方差公式,

Var(Y)=EVar(Y∣S)+Var(E[Y∣S]).

因为 Em(S)=π,后一方差就是 RES;二元 Y 的方差就是 UNC。代回即得恒等式。这一证明适用于任意报告分布,不需要 S 只有有限档,也不需要预报正确设模。

经验分组中的精确性边界 ​

若有限样本里每个组都对应同一个实际报告值 sj,以该组经验正例率 y¯j 和质量 nj/n 代入三项,经验版恒等式仍严格成立:它只是对经验分布使用同一代数恒等式。

若把一段内不同报告值先替成箱均值,再做分解,得到的是“分箱后预测器”的 Brier 分数,未必是原预测器的分数。例如两个观测为 (S,Y)=(0.2,0),(0.4,1),原分数是 (0.04+0.36)/2=0.20;把同一箱都改报 0.3 后,分数是 (0.09+0.49)/2=0.29。不能省掉 0.09 的差异,仍宣称对原报告做了精确分解。

推论与应用

由全方差公式,0≤RES≤UNC。当真实风险在各档仍介于零与一之间,档内标签随机性通常无法全部去除;分辨力并不会因为报告值更极端就自动增大,它取决于那些档的真实正例率。

更一般地,以更丰富的信息 Z 形成理想报告 E[Y∣Z],若旧信息是新信息的函数,则条件方差的平均不会上升,理想 Brier 风险不会变差。有限样本估计则可能因过拟合变差,所以增加特征不等于实际评估分数必降。

本分解适合定位改进方向:数值偏离真实频率时,校准后处理可能减少可靠度损失;所有档真实风险几乎相同时,需要更有信息的预测依据。单独压低经验校准误差,不能代替对独立数据上总体预测质量的检查。

参考资料
关系图谱5 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系