“这里的校准是报告概率的条件频率要求。后两个要求比较连续分数的条件平均值,不是equalized odds所比较的阈值后 TPR 和 FPR。若把 $S$ 改成一个阈值事件,需重新写定理。”
形式陈述
设真实标签为
以下是不同的数学要求,并非同一要求的几种名称。
选择比例平衡,常称 demographic parity,要求
不依赖
等化错误率,常称 equalized odds,要求
在二分类中,这等价于各组真阳性率和假阳性率都相同:
机会均等,常称 equal opportunity,只要求各组
另一个常见量是正预测值
各组 PPV 相同称为正类预测值平衡或 predictive parity。这里与 TPR 恰好交换了条件事件与待预测事件,通常数值不同。凡是分母事件概率为零,相应条件概率就不在该组定义;不能随意填零后继续比较。
若模型输出的是连续分数
这比只在整个总体中检查概率校准多保留了群组信息,也不等同于某个阈值之后的 PPV 平衡。
直觉
同一张群组混淆表,可以横着比较、按真实标签切片后比较,或者先挑出预测正类再比较。每种切法都在改变分母,因此都回答不同的问题。
例如两批图像的正类比例本来不同。让两批图像的 TPR 和 FPR 相同,意味着给定真实类别后分类器表现一致;却不意味着它最后输出相同比例的正类。后者还会随各批图像的真实类别混合比例变化。
例子与边界
同一错误率,不同选择比例
考虑两个各有
| 群组 | 真阳性 TP | 假阴性 FN | 假阳性 FP | 真阴性 TN |
|---|---|---|---|---|
| 甲 | 16 | 4 | 8 | 72 |
| 乙 | 48 | 12 | 4 | 36 |
甲组
但甲组选择比例为
不能把同一个分子 16 分别除以 20 和 24 后,仍把所得指标都叫“正类准确率”。
基率如何进入这些关系
记
若 equalized odds 使两率固定为
所以当基率不同且分类器确有
再用条件概率换算得
前提是分母非零。固定
后处理也需要说明它做了什么
对现有预测标签,可以按群组和原预测结果分别随机化新的标签。各组可达的
极端例子是完全忽略输入,以同一概率
推论与应用
这些指标描述给定数据分布里的统计关系。它们不自动判断标签是否测得准确、群组是否划分恰当,或者模型的用途是否公平;更不能单凭一张混淆表推出造成差异的因果机制。
对连续概率分数,校准与正负类平均分平衡还存在另一项精确限制。那里的“平均分平衡”比较
参考资料
- [1] Moritz Hardt, Eric Price, Nati Srebro, Equality of Opportunity in Supervised Learning, 2016,§2 的 Definitions 2.1–2.2,§4 的后处理构造。本文混淆表、基率恒等式和退化边界均按所列数值直接计算。