Skip to content

返回学习路线

单元终点任务:从可靠概率到选择性决策 ​

你要交付什么 ​

交付一份能由下面六行总体分布独立复算的预测审计。它应同时报告概率可靠性、平方评分、分类条件错误和拒绝后的表现;最后说明哪些群体约束不能一起要求。题目给的是总体分布,计算中的差异不是抽样噪声。

先读适当评分、概率校准、Brier 分解,再做主体任务。保序校准、温度缩放和多重校准是后处理分支;群体约束与不可兼得定理完成最后的解释。

已知分布 ​

群体 A∈{0,1} 各占一半。在每组内,低、中、高三个档位 J∈{L,M,H} 各占三分之一,因此每行联合质量都是 1/6。标签在给定行后服从 Bernoulli 分布,参数为表中的 η。

群体 档位 联合质量 真正正例率 η 模型报告 S
0 L 1/6 1/10 3/20
0 M 1/6 2/5 1/2
0 H 1/6 4/5 17/20
1 L 1/6 1/5 3/20
1 M 1/6 3/5 1/2
1 H 1/6 9/10 17/20

分类规则固定为 Y^=1{S≥1/2},所以中档平票时预测正类。拒绝成本固定为 c=1/5。

任务 ​

  1. 计算两组基率和总体基率。判断 S 是否总体校准、是否群体内校准;至少写出一个失败单元的偏差
  2. 计算 S 的 Brier 分数及 REL、RES、UNC。若可以使用整个行标记,把预测改成 T=η(A,J),分数会改善多少?为什么这与平方评分的严格适当性一致?
  3. 分别计算两组选择比例、TPR、FPR 和 PPV。判断 demographic parity、equalized odds 与 equal opportunity 是否成立
  4. 按 min(S,1−S)≤c 接受预测,计算覆盖率、无条件“接受且错误”概率、接受后的条件错误和计入拒绝后的总成本
  5. T=η(A,J) 已在每个群体内部校准。它能否同时让两组正类平均分相同、负类平均分也相同?分别计算这四个平均分,再用两行预算恒等式解释限制
  6. 独立做两个小型后处理练习:
    • 保序练习:六个互异分数排序后标签为 0,1,0,0,1,1,运行 PAV,交出每次合并、最终值和累计残差证书
    • 温度练习:四个同 logits 的样本具有差值 log⁡9,其中三正一负。求使 NLL 最小的有限温度;说明准确率为何不变
  7. 最后用一句准确的话说明:反复修正当前“群体×分数桶”的总体残差,为什么有一个统一的进展量;这为什么还不是有限样本泛化定理?

完整解答 ​

1. 总体可靠不等于群体内部可靠 ​

两组基率为

π0=1/10+2/5+4/53=1330,π1=1/5+3/5+9/103=1730.

总体基率为 1/2。每个报告档混合两个等质量群体,其真正正例率分别为

1/10+1/52=320,2/5+3/52=12,4/5+9/102=1720.

所以 E[Y∣S]=S,模型总体校准。它不满足群体内校准,例如群体0中档报 1/2,真实频率为 2/5,平均残差为 −1/10;群体1中档则为 +1/10。这些偏差被总体平均抵消。

2. Brier 分解与更细信息的价值 ​

总体校准使 REL 为零。真实档风险围绕基率 1/2 的偏移为 −7/20,0,7/20,因此

RES=13[(720)2+0+(720)2]=49600,UNC=14.

所以

BS(S)=0−49600+14=101600.

改用完整条件概率 T=η(A,J) 后,平方风险只剩每行 Bernoulli 方差:

BS(T)=16(0.09+0.24+0.16+0.16+0.24+0.09)=49300.

改善为

101600−49300=1200.

也可逐行算 E(S−T)2 得同一结果。严格适当性说完整条件概率逐点最优;S 的总体校准没有利用群体内还剩的信息,所以不与这份改善矛盾。

3. 分类条件化的分母不能交换 ​

两组都在中、高档预测正类,因此选择比例都为 2/3,满足 demographic parity。

群体0中,总正类质量在组内与 1/10+2/5+4/5=13/10 成比例,被选正类与 2/5+4/5=6/5 成比例,故

TPR0=1213,FPR0=(1−2/5)+(1−4/5)3−13/10=817.

群体1同理得到

TPR1=1517,FPR1=513.

TPR 不同,所以机会均等和等化错误率都不成立。正预测值分别为

PPV0=2/5+4/52=35,PPV1=3/5+9/102=34.

这里分母2来自每组被选的两档;它既不是组内全部正类量,也不是全部负类量。

4. 允许拒绝后的四个数 ​

低、高档的报告条件错误均为 3/20,中档为 1/2。按给定规则只接受低、高档,覆盖率为 2/3。

四个被接受行的真正条件分类错误依次为 1/10,1/5,1/5,1/10,故

Pr(接受且错误)=16(110+15+15+110)=110.

接受后的条件错误为

Rsel=1/102/3=320,

计入拒绝的总体成本为

Rc=110+15⋅13=16.

完整条件概率 T 对四个端档也满足 min(T,1−T)≤1/5;两个等号处取接受,得到同样规则。中间两行最小分类错误都是 2/5,应拒绝。

5. 校准与两项平均分平衡的冲突 ​

由于 T 是完整条件概率,

E[T∣Y=1,A=a]=E[T2∣A=a]πa.

逐行求平方得到

u0=81130,u1=121170.

同理,用 T(1−T) 得负类平均分

v0=49170,v1=49130.

正类平均不同,负类平均也不同。若硬要它们分别等于共同的 u,v,群体校准会要求

1330u+1730v=1330,1730u+1330v=1730.

相减得 u−v=1,结合 0≤u,v≤1 强迫 u=1,v=0。本分布每一行都保留标签随机性,仅观察 (A,J) 的预测器无法完美预测,因此三项精确要求无法同时实现。

6. 两个可执行后处理 ​

PAV 先把位置2、3的 1,0 合并为均值 1/2,再与位置4的0合并为均值 1/3,得到

q^=(0,1/3,1/3,1/3,1,1).

累计残差 λk=∑i≤k(yi−q^i) 为

(0,2/3,1/3,0,0,0).

它们非负,最终为零,拟合值严格上升处的残差为零,构成单调平方拟合的最优性证书。

温度练习中 pT=σ((log⁡9)/T)。经验正例率为 3/4,对数损失严格适当,使最优概率为 3/4。解 log⁡9/T=log⁡3,得 T=2。NLL 从约 0.654667 降到 0.562335,所有样本的最大 logit 类别保持为正,因此准确率仍为 3/4。

7. 修正进展与样本保证是两回事 ​

对当前质量为 μ、平均残差为 δ 的单元,把分数加 δ 后裁剪回 [0,1],会使统一势 Φ=E(f−η)2 至少下降 μδ2。当 μ≥γ 且 |δ|>α,每次至少有 γα2 级进展。

这里使用的是精确总体平均;有限数据中,单元本身随前次更新而改变。用同一数据反复估计这些自适应条件平均,还需独立样本或有效的数据复用论证,不能由势下降自动推出。

验收标准 ​

  • 六行质量与标签联合概率相容,基率与条件概率分母全部写清
  • 同时识别总体校准成立和群体内校准失败,不用一个经验 ECE 值替代这两个命题
  • Brier 直接计算、三项分解、后处理平方改进三种计算相互一致
  • 明确区分覆盖率、接受且错误、选择性风险和拒绝成本
  • 不把连续分数的平均平衡偷换为阈值后的 equalized odds
  • 给出 PAV 执行证书和温度值,解释计算最优不代表总体已校准
  • 能说明哪些结论用精确总体量,哪些结论还需要样本泛化保证

下载 Python 复算脚本。运行它会核对本任务的分数等式、正文数值和 PAV 的有限枚举证书;只需 Python 标准库。有限枚举不替代一般定理证明。