形式陈述
总体概率校准公理库概率校准与可靠度Probability calibration · Reliability diagram用条件正例率等于报告概率定义概率校准,计算可靠度与分箱误差,并区分校准、边际均值、分类一致性和分辨力。可能把两个子群方向相反的误差抵消掉。多重校准要求对一族指定群组同时检查报告概率,群组可以重叠,不必组成一个划分。
固定 的联合分布,其中 ;记真实条件概率 ,预测器为 。假定 、 和下文群组均可测。指定群组族 、容差 、最小单元质量 ,以及覆盖 的有限不交区间 。对当前预测器,审计单元为
本文使用一个明确的分箱版本:对所有 ,只要 ,就要求
这约束单元内的平均残差。若箱宽至多 ,箱中心为 ,则还能推出
它不要求质量不足 的单元有同样保证,也不等于不分箱、逐个精确分数的定义。原始多重校准工作对小单元的舍弃比例、离散化和样本学习采用更细的约定;其复杂度定理不能把参数直接换成这里的 后照抄。[1, §§2–3]
直觉
群组可以是不同地区、不同设备版本,或者它们的交集。整体预报正确不代表每个部署环境的报告都可靠。反过来,把每个环境单独修一次也不够:一个样本属于多个群组,修正其中一组会改变另一组的平均值。
所以算法必须反复审计当前预测器,而不是在开始时把各组统计一次就结束。好消息是,如果每次都针对一个确实存在的总体偏差作恰当修正,就能用同一个全局平方势衡量所有修正的进展。
例子与边界
总体已经校准,子群仍然失准
令四类对象等概率出现,真实风险为
初始全部报告 。总体正例率为 ,故这个常数报告在总体上精确校准。取两个重叠群组
并用区间 、。初始两群都全部落在上箱,但真实平均风险分别为 和 ,偏差方向正好相反。
先修 的上箱,残差为 ,得到
此时 两点仍在上箱,其平均报告为 、真实风险为 ,故加上 ,得到
第二步改动了交集对象 2。现在 的两点已经分到不同箱,必须按新的单元再次审计;不能拿第一轮的组平均正确作为停止证书。
总体精确查询下的有限步算法
先假设能得到每个当前单元的精确质量和总体平均残差。这是分析理想接口,不是把有限样本均值冒充总体。
如果某个质量 的单元 违反式 (1),令
并作更新
随后重新找违反单元。对有限 和有限分箱,可以逐一检查;群组族很大时,如何高效找到违反单元本身就是一个审计问题。有限更新次数不自动等于每次搜索都高效。
取势函数
在裁剪前,只在 上加 ,平方展开给出
因为 ,把任意实数投影回 只会减小它到 的距离。因此裁剪后仍有
势最多从 降到 ,所以不可能发生多于 次违反修正。停止时,每个质量足够的当前单元都满足式 (1)。这个结论的量词允许单元随 改变,因为每一步都用同一个 记账。
在刚才四点例中,势依次为
两次下降分别为 和 。某个旧单元重新失准,并未破坏全局下降。
从总体接口到有限数据还差什么
有标签样本只能估计 和 。两者的比值才是条件残差,质量下限 防止很小的分母放大估计误差。统计查询接口公理库统计查询模型statistical query model · SQ model让学习器查询有界统计量的近似期望,并以查询数、容差和计算量衡量效率。适合把所需容差单独列出,但必须把绝对误差换算到条件平均误差。
具体地,记 、。若两次有界统计查询各有绝对误差至多 ,则估计分母 ,且由 可得
因此取 可把条件残差误差控制到 ;判断单元质量是否达到 时也应给估计误差留出间隙。这只是查询精度的转换,完整的近似更新算法还须重新证明其停止和势下降条件。
更重要的是,当前分数桶取决于前面用数据做过的更新。它们不是训练前固定的一组查询。反复复用同一批数据涉及自适应数据分析公理库自适应数据分析Adaptive data analysis · Adaptive statistical queries描述同一数据上的自适应查询,并以完整反馈记录的有限比特预算证明最终查询的泛化保证。;简单实现可以为各轮使用新的独立样本,精细实现则需要专门的泛化论证。上面的势下降只证明总体算法,不提供一个未经证明的样本复杂度。
推论与应用
群组族应由实际需要和可识别性决定。要求所有可测子群都满足极小容差,可能接近要求逐点学准 ,与有限样本和计算预算冲突。即使只检查较大群组,也应说明是否包含其交集:分别校准设备与地区,不自动校准“某地区中的某设备”。
多重校准与群体公平准则公理库分类中的群体公平准则Demographic parity · Equalized odds · Equality of opportunity用不同条件独立关系区分选择比例平衡、等化错误率、机会均等与概率校准,并在同一混淆表中计算它们的差异。也不是同义词。它约束每个报告档内的平均真实风险,未要求各组输出正类的比例相同,更未证明数据标签或使用方式本身公平。它提供的是一组可核查的概率可靠性要求。
参考资料