形式陈述
令 Y ∈ { 0 , 1 } ,报告概率为 S ∈ [ 0 , 1 ] ,总体正例率为 π = E Y ,且
m ( S ) = E [ Y ∣ S ] . 二元 Brier 分数采用
BS = E ( S − Y ) 2 这一归一化;若把两类完整概率向量与 one-hot 向量的平方差相加,数值会是本文的两倍。
定义三个非负量:
REL = E ( S − m ( S ) ) 2 , RES = E ( m ( S ) − π ) 2 , UNC = π ( 1 − π ) . 则有可靠度—分辨力分解
BS = REL − RES + UNC . 可靠度项衡量概率校准 公理库 概率校准与可靠度 Probability calibration · Reliability diagram 用条件正例率等于报告概率定义概率校准,计算可靠度与分箱误差,并区分校准、边际均值、分类一致性和分辨力。 偏差,越小越好;分辨力项衡量不同报告档的真实风险相差多少,越大越好;不确定性项是总体 Bernoulli 结果本身的方差 公理库 方差 Variance 随机变量相对其均值的平方偏差期望,也是最佳常数平方预测的剩余误差。 。三个量均非负,但分辨力在恒等式中被减去。[1,3]
直觉
从“所有情况都报总体正例率”出发,基线平方误差就是 π ( 1 − π ) 。有用的预测器把样本分成真实风险不同的档位,因此减少了箱内还剩的随机性;这份收益是分辨力。若档位虽有用,报出的数值却偏离档内真实频率,又会付出可靠度损失。
这个顺序解释了一个常见误会:完全校准不代表已经没有改进空间。常报基率的预测器可靠度项为零,分辨力也为零;能可靠地区分高低风险的模型,可以在仍然校准的同时获得更低 Brier 分数。
图片加载失败
例子与边界
一份可以逐格验算的预报
令两种报告等概率出现:S = 0.2 时真实正例率为 0.1 ,S = 0.8 时为 0.7 。因此
π = 1 2 ( 0.1 + 0.7 ) = 0.4 , UNC = 0.4 × 0.6 = 0.24 . 两档都高报了 0.1 ,所以
REL = 1 2 ( 0.2 − 0.1 ) 2 + 1 2 ( 0.8 − 0.7 ) 2 = 0.01 . 真实风险分别离基率 0.3 ,故
RES = 1 2 ( 0.1 − 0.4 ) 2 + 1 2 ( 0.7 − 0.4 ) 2 = 0.09 . 分解给出 BS = 0.01 − 0.09 + 0.24 = 0.16 。也可直接按标签求平均:
BS = 1 2 [ 0.1 ( 1 − 0.2 ) 2 + 0.9 ( 0.2 ) 2 ] + 1 2 [ 0.7 ( 1 − 0.8 ) 2 + 0.3 ( 0.8 ) 2 ] = 1 2 ( 0.10 + 0.22 ) = 0.16 . 若把两档改报成正确的 0.1 , 0.7 ,分辨力不变,可靠度损失降为零,分数变成 0.15 。若索性只报 0.4 ,虽然也校准,却失去全部分辨力,分数回到 0.24 。
分解为什么成立
写 S − Y = ( S − m ) + ( m − Y ) 并平方。给定 S 后,S − m 是确定量,而 E [ m − Y ∣ S ] = 0 ,交叉项消失。因此
E ( S − Y ) 2 = E ( S − m ) 2 + E Var ( Y ∣ S ) . 再用全方差公式 公理库 全期望公式与全方差公式 Law of total expectation · Law of total variance · Iterated expectation 借助条件信息分解总体均值,并把总波动拆成组内与组间两部分。 ,
Var ( Y ) = E Var ( Y ∣ S ) + Var ( E [ Y ∣ S ] ) . 因为 E m ( S ) = π ,后一方差就是 RES ;二元 Y 的方差就是 UNC 。代回即得恒等式。这一证明适用于任意报告分布,不需要 S 只有有限档,也不需要预报正确设模。
经验分组中的精确性边界
若有限样本里每个组都对应同一个实际报告值 s j ,以该组经验正例率 y ¯ j 和质量 n j / n 代入三项,经验版恒等式仍严格成立:它只是对经验分布使用同一代数恒等式。
若把一段内不同报告值先替成箱均值,再做分解,得到的是“分箱后预测器”的 Brier 分数,未必是原预测器的分数。例如两个观测为 ( S , Y ) = ( 0.2 , 0 ) , ( 0.4 , 1 ) ,原分数是 ( 0.04 + 0.36 ) / 2 = 0.20 ;把同一箱都改报 0.3 后,分数是 ( 0.09 + 0.49 ) / 2 = 0.29 。不能省掉 0.09 的差异,仍宣称对原报告做了精确分解。
推论与应用
由全方差公式,0 ≤ RES ≤ UNC 。当真实风险在各档仍介于零与一之间,档内标签随机性通常无法全部去除;分辨力并不会因为报告值更极端就自动增大,它取决于那些档的真实正例率 。
更一般地,以更丰富的信息 Z 形成理想报告 E [ Y ∣ Z ] ,若旧信息是新信息的函数,则条件方差的平均不会上升,理想 Brier 风险不会变差。有限样本估计则可能因过拟合变差,所以增加特征不等于实际评估分数必降。
本分解适合定位改进方向:数值偏离真实频率时,校准后处理 公理库 保序概率校准与相邻块合并 Isotonic probability calibration · Pool adjacent violators 在独立校准集上用相邻违反块合并求最优非降概率映射,给出完整执行轨迹、线性时间不变量和累计残差最优性证书。 可能减少可靠度损失;所有档真实风险几乎相同时,需要更有信息的预测依据。单独压低经验校准误差,不能代替对独立数据上总体预测质量的检查。
参考资料
[1] Allan H. Murphy, A New Vector Partition of the Probability Score , Journal of Applied Meteorology 12(4), 1973, pp. 595–600。二元概率评分分解的原始文献。
[2] Tilmann Gneiting and Adrian E. Raftery, Strictly Proper Scoring Rules, Prediction, and Estimation , 2007,§§2.3、3.3:Brier 评分、基线预报与概率评分的比较。
[3] Jochen Bröcker, Estimating Reliability and Resolution of Probability Forecasts through Decomposition of the Empirical Score , 2011 年修订稿,§§2.2–2.3,式 (6)、(8)、(13)–(14):总体与经验分解的区别。