“若动作还允许拒绝,条件成本要再加入拒绝代价,并同时报告接受覆盖率与接受后错误;完整规则见选择性分类。若另要求跨群组的选择比例或条件错误率满足约束,优化目标也要增加相应条件,见群体公平准则。对…”
形式陈述
令
满足
- 群体内校准:
- 正类平均分平衡:
- 负类平均分平衡:
那么三者同时成立,必推出
也就是说,全部正类得到分数一,全部负类得到分数零,预测完美。这是校准与群体平衡的不可兼得性的一种精确概率表述。[1, Theorem 1.1、§2]
这里的校准是报告概率的条件频率要求。后两个要求比较连续分数的条件平均值,不是equalized odds所比较的阈值后 TPR 和 FPR。若把
直觉
校准先固定了每组能够发出的“总分预算”:一组正类占几成,所有分数的平均就必须是几成。如果又要求两组正类拿到同一个平均分
当两组基率不同,两份混合预算给出两条不同的直线。它们在允许的平均分范围内只能交在
例子与边界
两行恒等式完成证明
由群体内校准和全期望,对每一组
设正类共同平均分为
两式相减:
因为基率不同,可以除去该差,得到
还需从“平均分到边界”走到“每个分数到边界”。对任一组,
保住校准,会怎样打破平均分平衡
令分数只有
甲组有
校准意味着
两者约为
它们也不相同。这个例子没有制造失准来解释冲突:它在每组每档都精确校准,只是两项平均分平衡必须让步。
哪些条件一变,结论就不再强迫完美预测
若两组基率相同为
若不要求群体内校准,给所有对象同一个分数当然能让正负类平均都跨组一致。若只保留其中一项平均分平衡,方程也不再构成这里的两项共同约束。定理没有说任意两个公平要求都冲突。
完美预测本身是一个数学例外,不保证在给定特征下可实现。若分数只能依据
推论与应用
使用这个定理时,先检查三项指标的定义、基率差和是否允许完美预测,而不是看到两组错误率不同就引用一句“不可能公平”。它精确解释了一组统计约束之间的冲突,没有替人决定应当优先保留哪一项。
有限数据中,近似校准和近似平衡也不等于上述精确条件。尤其当两组基率非常接近时,证明中的除法会放大误差;精确零误差定理不能直接给出一个不含基率差的稳健数值界。若要作近似结论,需另行保留各项容差并做误差分析。[1, Theorem 1.2]
与多重校准并用时,也应保留这种区分:在更多群组里提高概率可靠性,并不自动产生正负类平均分平衡。二者是不同的、可能相互牵制的目标。
参考资料
- [1] Jon Kleinberg, Sendhil Mullainathan, Manish Raghavan, Inherent Trade-Offs in the Fair Determination of Risk Scores, ITCS 2017,Theorem 1.1、§2(精确约束),Theorem 1.2(近似版本)。本文用条件期望写出两行预算恒等式,再补足从极端平均推出几乎处处完美预测的步骤。