形式陈述
预测器可以输出类别,也可以拒绝作答。令 是分类规则, 是接受概率;给定 后,接受所用的随机币独立于 。确定性选择对应 。
覆盖率与选择性风险分别为
后者只在覆盖率为正时定义,表示“已经接受作答的样本中,错误占多少”。全部拒绝时不能把 记成零风险,再声称得到完美预测器。
另一种目标给每次拒绝指定成本 :
本文取 。因此正确预测成本零,错误成本一,拒绝成本介于两者之间。它与固定覆盖率下最小化 是相关但不同的优化问题。[1,2]
令 。在Bayes 决策公理库Bayes 预测器与 Bayes 风险Bayes predictor · Bayes classifier · Bayes risk已知真实联合分布时逐点最小化条件损失所得的最优决策。允许的全部规则中,三种动作的条件成本为
动作拒绝条件成本于是一个最优规则为: 预测 0, 预测 1,中间拒绝;边界相等时可任选或随机化,并应明确平票约定。
直觉
拒绝让预测器把有限的错误预算集中在较有把握的部分样本上。但覆盖率会随之下降,所以不能只报告“接受后错误很低”。同时写出低错误覆盖了多少输入,才能知道这个系统实际完成了多少工作。
拒绝成本把这个取舍变成清楚的条件比较。面对一个正例率 的输入,猜较可能的负类仍有 错误率;若拒绝只需付 ,应拒绝。面对正例率 的输入,预测正类只承担 ,就不值得付更高的拒绝成本。
例子与边界
把三种风险都算出来
四类输入的质量与真实正例率为
| 输入类 |
质量 |
|
最优分类的条件错误 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
若必须全部作答,Bayes 分类风险为
取拒绝成本 ,只接受 。覆盖率为 ,无条件“接受且错误”概率为
因此接受后的条件风险是 ;计入拒绝后的总成本则是
、、 回答三个不同问题,不能只选最小的数作为系统错误率。
固定覆盖率时应该接受谁
固定分类器 ,定义其条件错误 。若要求覆盖率恰好为 ,分母固定,目标等价于
最优方案按 从小到大接受,在临界错误水平的平票处随机化,以补齐所需质量。证明可以直接交换:若较差点有正接受量而较好点仍有拒绝量,把同样概率质量从前者移到后者,覆盖率不变,错误分子下降。
更一般地,设阈值 及 实现所需覆盖率,低于 全收、高于 全拒。对任意同覆盖率 ,
低风险侧两个因子都非正,高风险侧都非负,平票处为零。若 也可选,先逐点取 Bayes 类别,最小条件错误便是 。未知数据分布下,用估计置信度排序只是近似执行这一步。
校准能支持哪种拒绝规则
若 已经概率校准公理库概率校准与可靠度Probability calibration · Reliability diagram用条件正例率等于报告概率定义概率校准,计算可靠度与分箱误差,并区分校准、边际均值、分类一致性和分辨力。,分类和接受都只依赖 ,取 ,则
只接受 的分数,并且覆盖率为正,就可用条件概率公理库条件概率Conditional probability在已知正概率事件发生后,把交集概率重新规范到该事件内部。平均得 。这是总体校准下的结论,不适用于仅有一张噪声很大的经验可靠度图。
“只依赖 ”也有实际意义。若一个校准模型恒报 ,整体恰有九成正例;另有特征可挑出剩下的一成负例。若只在这些负例上接受,却仍按 预测正类,选择性风险就是一。按额外信息筛选后,原来按 的校准未必保留;需要更细的条件校准保证。
推论与应用
风险—覆盖曲线必须同时固定排序规则和评估分布。用独立评估样本检查不同覆盖率下的错误,可以发现“高置信度先错”的失败情形;根据同一评估集反复选择阈值,又会引入模型选择偏差。
拒绝输出也不同于共形预测集合公理库分割共形预测Split conformal prediction · 分割保形预测用冻结评分规则的校准秩构造预测集合,并在预先固定群组内分别校准,以获得边际或群组覆盖保证。。后者通常控制真标签落入集合的边际概率;只接受单元素集合后,接受样本上的条件错误未必仍小于同一个显著性水平。若要从一个保证推出另一个,必须把选择事件的分母及允许的条件化范围写出来。
参考资料