Skip to content

定义Definition

多重校准

Multicalibration

对预先指定的重叠群组及分数桶同时约束平均校准误差,以总体残差修正和平方势下降证明有限步可达,并分开处理样本泛化。

形式陈述 ​

总体概率校准可能把两个子群方向相反的误差抵消掉。多重校准要求对一族指定群组同时检查报告概率,群组可以重叠,不必组成一个划分。

固定 (X,Y) 的联合分布,其中 Y∈{0,1};记真实条件概率 η(x)=Pr(Y=1∣X=x),预测器为 f:X→[0,1]。假定 f、η 和下文群组均可测。指定群组族 C、容差 α>0、最小单元质量 γ>0,以及覆盖 [0,1] 的有限不交区间 I1,…,IM。对当前预测器,审计单元为

BC,j(f)={x:x∈C, f(x)∈Ij}.

本文使用一个明确的分箱版本:对所有 C∈C,j,只要 Pr(X∈BC,j(f))≥γ,就要求

(1)|E[Y−f(X)∣X∈BC,j(f)]|≤α.

这约束单元内的平均残差。若箱宽至多 h,箱中心为 vj,则还能推出

|E[Y∣X∈BC,j(f)]−vj|≤α+h/2.

它不要求质量不足 γ 的单元有同样保证,也不等于不分箱、逐个精确分数的定义。原始多重校准工作对小单元的舍弃比例、离散化和样本学习采用更细的约定;其复杂度定理不能把参数直接换成这里的 α,γ,h 后照抄。[1, §§2–3]

直觉

群组可以是不同地区、不同设备版本,或者它们的交集。整体预报正确不代表每个部署环境的报告都可靠。反过来,把每个环境单独修一次也不够:一个样本属于多个群组,修正其中一组会改变另一组的平均值。

所以算法必须反复审计当前预测器,而不是在开始时把各组统计一次就结束。好消息是,如果每次都针对一个确实存在的总体偏差作恰当修正,就能用同一个全局平方势衡量所有修正的进展。

例子与边界

总体已经校准,子群仍然失准 ​

令四类对象等概率出现,真实风险为

η=(0.9,0.5,0.1,0.5),

初始全部报告 f=(0.5,0.5,0.5,0.5)。总体正例率为 0.5,故这个常数报告在总体上精确校准。取两个重叠群组

C1={1,2},C2={2,3},

并用区间 [0,0.5)、[0.5,1]。初始两群都全部落在上箱,但真实平均风险分别为 0.7 和 0.3,偏差方向正好相反。

先修 C1 的上箱,残差为 δ1=0.7−0.5=0.2,得到

f(1)=(0.7,0.7,0.5,0.5).

此时 C2 两点仍在上箱,其平均报告为 0.6、真实风险为 0.3,故加上 δ2=−0.3,得到

f(2)=(0.7,0.4,0.2,0.5).

第二步改动了交集对象 2。现在 C1 的两点已经分到不同箱,必须按新的单元再次审计;不能拿第一轮的组平均正确作为停止证书。

总体精确查询下的有限步算法 ​

先假设能得到每个当前单元的精确质量和总体平均残差。这是分析理想接口,不是把有限样本均值冒充总体。

如果某个质量 μ≥γ 的单元 B 违反式 (1),令

δ=E[Y−f(X)∣X∈B],

并作更新

f+(x)={clip[0,1](f(x)+δ),x∈B,f(x),x∉B.

随后重新找违反单元。对有限 C 和有限分箱,可以逐一检查;群组族很大时,如何高效找到违反单元本身就是一个审计问题。有限更新次数不自动等于每次搜索都高效。

取势函数

Φ(f)=E(f(X)−η(X))2∈[0,1].

在裁剪前,只在 B 上加 δ,平方展开给出

Φ(f+δ1B)−Φ(f)=2μδE[f−η∣B]+μδ2=−μδ2.

因为 η(x)∈[0,1],把任意实数投影回 [0,1] 只会减小它到 η(x) 的距离。因此裁剪后仍有

Φ(f)−Φ(f+)≥μδ2>γα2.

势最多从 1 降到 0,所以不可能发生多于 1/(γα2) 次违反修正。停止时,每个质量足够的当前单元都满足式 (1)。这个结论的量词允许单元随 f 改变,因为每一步都用同一个 Φ 记账。

在刚才四点例中,势依次为

0.08⟶0.06⟶0.015.

两次下降分别为 (1/2)(0.2)2=0.02 和 (1/2)(0.3)2=0.045。某个旧单元重新失准,并未破坏全局下降。

从总体接口到有限数据还差什么 ​

有标签样本只能估计 E[1B(Y−f(X))] 和 Pr(B)。两者的比值才是条件残差,质量下限 γ 防止很小的分母放大估计误差。统计查询接口适合把所需容差单独列出,但必须把绝对误差换算到条件平均误差。

具体地,记 a=E[1B(Y−f)]、μ=Pr(B)≥γ。若两次有界统计查询各有绝对误差至多 τ≤γ/2,则估计分母 μ^≥γ/2,且由 |a|≤μ 可得

|a^μ^−aμ|≤τ+τ|a|/μγ−τ≤4τγ.

因此取 0<τ≤min{γ/2,αγ/8} 可把条件残差误差控制到 α/2;判断单元质量是否达到 γ 时也应给估计误差留出间隙。这只是查询精度的转换,完整的近似更新算法还须重新证明其停止和势下降条件。

更重要的是,当前分数桶取决于前面用数据做过的更新。它们不是训练前固定的一组查询。反复复用同一批数据涉及自适应数据分析;简单实现可以为各轮使用新的独立样本,精细实现则需要专门的泛化论证。上面的势下降只证明总体算法,不提供一个未经证明的样本复杂度。

推论与应用

群组族应由实际需要和可识别性决定。要求所有可测子群都满足极小容差,可能接近要求逐点学准 η,与有限样本和计算预算冲突。即使只检查较大群组,也应说明是否包含其交集:分别校准设备与地区,不自动校准“某地区中的某设备”。

多重校准与群体公平准则也不是同义词。它约束每个报告档内的平均真实风险,未要求各组输出正类的比例相同,更未证明数据标签或使用方式本身公平。它提供的是一组可核查的概率可靠性要求。

参考资料
  • [1] Úrsula Hébert-Johnson, Michael P. Kim, Omer Reingold, Guy N. Rothblum, Multicalibration: Calibration for the (Computationally-Identifiable) Masses, ICML 2018,§2(校准与离散化)、§3.1(反复修正和自适应查询)。本文明确采用带单元质量下限的分箱版本,并完整证明其精确总体查询算法的平方势界;不将此界等同于原文有限样本定理。
关系图谱4 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系