返回学习路线
单元终点任务:从可靠概率到选择性决策
你要交付什么
交付一份能由下面六行总体分布独立复算的预测审计。它应同时报告概率可靠性、平方评分、分类条件错误和拒绝后的表现;最后说明哪些群体约束不能一起要求。题目给的是总体分布,计算中的差异不是抽样噪声。
先读适当评分公理库适当评分规则Proper scoring rule · Strictly proper scoring rule以真实分布为总体期望损失的最优报告,区分适当与严格适当评分,并由凹熵的支撑线构造二元概率损失。、概率校准公理库概率校准与可靠度Probability calibration · Reliability diagram用条件正例率等于报告概率定义概率校准,计算可靠度与分箱误差,并区分校准、边际均值、分类一致性和分辨力。、Brier 分解公理库Brier 分数的可靠度—分辨力分解Brier score decomposition · Murphy decomposition把二元概率平方误差严格分为可靠度损失减分辨力加基率不确定性,并逐项算出校准修正和无信息预报的差别。,再做主体任务。保序校准公理库保序概率校准与相邻块合并Isotonic probability calibration · Pool adjacent violators在独立校准集上用相邻违反块合并求最优非降概率映射,给出完整执行轨迹、线性时间不变量和累计残差最优性证书。、温度缩放公理库温度缩放概率校准Temperature scaling固定分类 logits 后以一个正温度重新分配概率,证明类别排序不变及逆温度目标的凸性,并算出可修正和无法修正的校准例子。和多重校准公理库多重校准Multicalibration对预先指定的重叠群组及分数桶同时约束平均校准误差,以总体残差修正和平方势下降证明有限步可达,并分开处理样本泛化。是后处理分支;群体约束公理库分类中的群体公平准则Demographic parity · Equalized odds · Equality of opportunity用不同条件独立关系区分选择比例平衡、等化错误率、机会均等与概率校准,并在同一混淆表中计算它们的差异。与不可兼得定理公理库校准与群体平衡的不可兼得性Calibration fairness impossibility在不同非退化基率下,用两条平均分恒等式证明群体内概率校准与正负类平均分平衡只有完美预测例外,并区分阈值错误率条件。完成最后的解释。
已知分布
群体 各占一半。在每组内,低、中、高三个档位 各占三分之一,因此每行联合质量都是 。标签在给定行后服从 Bernoulli 分布,参数为表中的 。
| 群体 |
档位 |
联合质量 |
真正正例率 |
模型报告 |
| 0 |
L |
|
|
|
| 0 |
M |
|
|
|
| 0 |
H |
|
|
|
| 1 |
L |
|
|
|
| 1 |
M |
|
|
|
| 1 |
H |
|
|
|
分类规则固定为 ,所以中档平票时预测正类。拒绝成本固定为 。
任务
- 计算两组基率和总体基率。判断 是否总体校准、是否群体内校准;至少写出一个失败单元的偏差
- 计算 的 Brier 分数及 REL、RES、UNC。若可以使用整个行标记,把预测改成 ,分数会改善多少?为什么这与平方评分的严格适当性一致?
- 分别计算两组选择比例、TPR、FPR 和 PPV。判断 demographic parity、equalized odds 与 equal opportunity 是否成立
- 按 接受预测,计算覆盖率、无条件“接受且错误”概率、接受后的条件错误和计入拒绝后的总成本
- 已在每个群体内部校准。它能否同时让两组正类平均分相同、负类平均分也相同?分别计算这四个平均分,再用两行预算恒等式解释限制
- 独立做两个小型后处理练习:
- 保序练习:六个互异分数排序后标签为 ,运行 PAV,交出每次合并、最终值和累计残差证书
- 温度练习:四个同 logits 的样本具有差值 ,其中三正一负。求使 NLL 最小的有限温度;说明准确率为何不变
- 最后用一句准确的话说明:反复修正当前“群体×分数桶”的总体残差,为什么有一个统一的进展量;这为什么还不是有限样本泛化定理?
完整解答
1. 总体可靠不等于群体内部可靠
两组基率为
总体基率为 。每个报告档混合两个等质量群体,其真正正例率分别为
所以 ,模型总体校准。它不满足群体内校准,例如群体0中档报 ,真实频率为 ,平均残差为 ;群体1中档则为 。这些偏差被总体平均抵消。
2. Brier 分解与更细信息的价值
总体校准使 REL 为零。真实档风险围绕基率 的偏移为 ,因此
所以
改用完整条件概率 后,平方风险只剩每行 Bernoulli 方差:
改善为
也可逐行算 得同一结果。严格适当性说完整条件概率逐点最优; 的总体校准没有利用群体内还剩的信息,所以不与这份改善矛盾。
3. 分类条件化的分母不能交换
两组都在中、高档预测正类,因此选择比例都为 ,满足 demographic parity。
群体0中,总正类质量在组内与 成比例,被选正类与 成比例,故
群体1同理得到
TPR 不同,所以机会均等和等化错误率都不成立。正预测值分别为
这里分母2来自每组被选的两档;它既不是组内全部正类量,也不是全部负类量。
4. 允许拒绝后的四个数
低、高档的报告条件错误均为 ,中档为 。按给定规则只接受低、高档,覆盖率为 。
四个被接受行的真正条件分类错误依次为 ,故
接受后的条件错误为
计入拒绝的总体成本为
完整条件概率 对四个端档也满足 ;两个等号处取接受,得到同样规则。中间两行最小分类错误都是 ,应拒绝。
5. 校准与两项平均分平衡的冲突
由于 是完整条件概率,
逐行求平方得到
同理,用 得负类平均分
正类平均不同,负类平均也不同。若硬要它们分别等于共同的 ,群体校准会要求
相减得 ,结合 强迫 。本分布每一行都保留标签随机性,仅观察 的预测器无法完美预测,因此三项精确要求无法同时实现。
6. 两个可执行后处理
PAV 先把位置2、3的 合并为均值 ,再与位置4的0合并为均值 ,得到
累计残差 为
它们非负,最终为零,拟合值严格上升处的残差为零,构成单调平方拟合的最优性证书。
温度练习中 。经验正例率为 ,对数损失严格适当,使最优概率为 。解 ,得 。NLL 从约 降到 ,所有样本的最大 logit 类别保持为正,因此准确率仍为 。
7. 修正进展与样本保证是两回事
对当前质量为 、平均残差为 的单元,把分数加 后裁剪回 ,会使统一势 至少下降 。当 且 ,每次至少有 级进展。
这里使用的是精确总体平均;有限数据中,单元本身随前次更新而改变。用同一数据反复估计这些自适应条件平均,还需独立样本或有效的数据复用论证,不能由势下降自动推出。
验收标准
- 六行质量与标签联合概率相容,基率与条件概率分母全部写清
- 同时识别总体校准成立和群体内校准失败,不用一个经验 ECE 值替代这两个命题
- Brier 直接计算、三项分解、后处理平方改进三种计算相互一致
- 明确区分覆盖率、接受且错误、选择性风险和拒绝成本
- 不把连续分数的平均平衡偷换为阈值后的 equalized odds
- 给出 PAV 执行证书和温度值,解释计算最优不代表总体已校准
- 能说明哪些结论用精确总体量,哪些结论还需要样本泛化保证
下载 Python 复算脚本。运行它会核对本任务的分数等式、正文数值和 PAV 的有限枚举证书;只需 Python 标准库。有限枚举不替代一般定理证明。