Skip to content

定理Theorem

给定校准资料后的共形覆盖

Calibration-conditional conformal prediction · PAC conformal calibration · Training-conditional coverage

把部署规则的条件覆盖率视为随校准资料变化的随机量,以顺序统计量和精确二项尾选择满足双层概率目标的校准秩。

一套方法平均能覆盖80%的未来响应,不意味着拿到任意一份校准资料后,它的真实覆盖率都至少80%。本页固定训练模型,把校准资料本身当作外层随机性,直接计算不同校准结果之间的覆盖波动,并据此选择阈值。

形式陈述 ​

内层是未来覆盖,外层是校准资料 ​

条件于独立的训练资料,冻结可测实值评分 s(x,y)。令 Z1,…,Zn,Zn+1 为来自同一总体的IID样本,Si=s(Zi),分数分布函数记为F。预先固定秩 1≤k≤n,按分割共形的评分接受规则令

Q=S(k),CD(x)={y:s(x,y)≤Q},

其中 D=(Z1,…,Zn)。给定这份校准资料后,部署规则的覆盖率为

(1)c(D)=P{Yn+1∈CD(Xn+1)∣D,训练资料}=F(Q).

这里的条件概率固定了整份校准资料,但仍平均未来输入和响应。若F连续,则 c(D) 在 (0,1) 上的密度为

(2)fk(v)=n!(k−1)!(n−k)!vk−1(1−v)n−k,

即参数 k,n+1−k 的Beta分布,且

EDc(D)=kn+1,VarDc(D)=k(n+1−k)(n+1)2(n+2).

对预定目标 0<α,δ<1,精确外层失败概率是

(3)PD{c(D)<1−α}=∑j=kn(nj)(1−α)jαn−j.

所以选最小的 k,使式(3)不超过δ,就有

(4)PD{c(D)≥1−α}≥1−δ.

若没有有限 k 满足条件,则取 k=n+1,Q=+∞,返回所有候选响应;此时 c(D)=1。有并列的分数也可用同一二项尾取得保守的式(4),但一般不再有式(2)或式(3)的等号。

直觉

标准秩校准关注一次未来点是否进入集合。这里则问:固定这次已经校准出的集合规则,未来总体有多大一部分会进入它?这是一个介于零与一之间的数,但换一批校准资料,这个数就会变化。

分数阈值 Q 本身带着原响应单位,可能很难分析。把它送入真实分布函数F,得到的是“分数总体在阈值下方占多少质量”,恰好就是条件覆盖率。连续分布下,概率坐标的每一个样本都均匀,故覆盖波动只由 n 和 k 决定,不由评分单位决定。

Beta密度并不需要先假设参数模型 ​

当F连续时,Ui=F(Si) 是独立的 [0,1] 均匀变量。这可由分位数阈值检查:对每个 0<v<1,选F到达v的边界点;平坦区间没有概率质量,因此 P(F(Si)≤v)=v。不要求F处处有正密度,也不要求在整条实线上严格增加。

F单调使 F(S(k))=U(k)。运用顺序统计量的计数接口,U(k)≤v 等价于至少k个均匀变量不超过v,因此由二项分布

P{U(k)≤v}=∑j=kn(nj)vj(1−v)n−j.

对这个多项式求导,相邻项望远镜消去,得到式(2)。其均值、二阶矩可分别对 vfk(v),v2fk(v) 积分;整数指数下反复分部积分给

EU(k)=kn+1,EU(k)2=k(k+1)(n+1)(n+2),

相减即得方差。将 v=1−α 代入连续CDF便是式(3)。

例子与边界

平均80%覆盖,却有40.96%的校准资料达不到80% ​

取 n=4,k=4,即用四个校准分数的最大值为阈值。连续分数下平均覆盖率为 4/5。但对 α=1/5,

PD{c(D)<4/5}=(4/5)4=0.4096.

可直接看这个事件:四个校准分数都落在总体最低的80%范围里,于是它们的最大值仍没到80%分位。名义边际覆盖没有出错,只是它没有承诺“95%的校准资料都达到80%”。

若要求后一份合同,δ=0.05,n=4时没有有限秩能满足,必须增加校准样本或使用无穷阈值。

图中横轴v是部署规则的总体覆盖水平,左图纵轴才是校准资料产生不足覆盖的概率;右图另列平均覆盖,避免把这两个数当成一个。

二项认证何时允许有限阈值 ​

按式(3)的分布无关二项认证规则,对固定 n,上界随 k 增大而下降;有限秩中最保守的是 k=n,其二项尾为 (1−α)n。所以至少有一个有限秩能通过这份认证,当且仅当

(5)(1−α)n≤δ,即n≥⌈log⁡δlog⁡(1−α)⌉.

连续F时二项尾就是精确失败概率,式(5)也成为当前有限秩程序达到式(4)的必要条件。离散F可能更早达标,例如后文的恒零分数;不能把这条门槛解释成每个固定总体都必需的样本数。

按上述二项认证,要求95%的校准资料达到80%覆盖,最少需14个校准观测:0.813≈0.054976>0.05,0.814≈0.043980≤0.05。若目标改为90%覆盖、同样95%的校准成功率,最少需29个。这里都选最大分数,集合可能很宽;式(5)只说明有限阈值首次通过这份分布无关二项认证,不保证实用效率。

有更多资料时,可按式(3)选择较小秩,得到更紧的嵌套接受集合。这个秩由 n、α、δ预先算出,不需读取校准分数的实际大小。

离散分数:保留非严格接受,不硬套连续密度 ​

若 Si 恒为零,任何有限 k 都有 Q=0,c(D)=1;它显然不服从式(2)。离散分数的并列会增加使用 S≤Q 时的覆盖。

一般地,给每个分数配一个独立均匀变量V,令

U=F(S−)+V{F(S)−F(S−)}.

这个变换把每个原子的质量均匀铺在其对应CDF跳跃区间;连续部分按F映射,因此 P(U≤u)=u。逐点有 U≤F(S),从而排序后 U(k)≤F(S(k))。于是

PD{F(S(k))<1−α}≤P{U(k)<1−α},

右端仍是式(3)的二项尾。辅助V仅用于证明这个耦合,不要求实际随机化接受规则。若把非严格接受改成严格 S<Q,零分数例的覆盖会变成零,当前保证随即消失。

推论与应用

与分位置信区间的工具共享与输出区别 ​

分布无关分位置信区间也是把固定总体分位是否落在样本次序统计量之间,化成一个二项计数。本页用同一计数接口规划一个随机部署规则,使它在好校准资料上的未来覆盖率达标。报告时应同时给出 n、k、α、δ和接受规则,不能只写一个“置信水平”。

这也是高概率风险校准在零一漏覆盖损失上的一种精确秩实现,但本页额外利用冻结评分的嵌套水平集与连续分数分布。算法或目标存在联系,并不意味着可以不加条件地套用任何风险上界。

数据使用和计算边界 ​

式(1)用到未来分数在给定校准资料后仍服从F,这是IID及独立训练的作用。只有有限可交换性时,未来条件分布可能随D改变,不能直接写成同一个F(Q)。分割共形的边际保证仍可能成立,但本页的Beta与二项计算不能照搬。

同一批校准资料上试多个评分函数、分位模型或秩,再选择最窄结果,会把所选对象变成数据依赖菜单。每个固定对象的式(4)并不自动成为选择后的保证,应另用独立选择资料或同时校正。

可先从 k=n 向下累加二项质量,找最后一个仍满足δ的秩;n项递推即为 O(n) 次算术运算。小尾概率要用精确有理数、对数计算或可靠的尾概率程序,避免相减消失。确定 k 后,对校准分数排序为 O(nlog⁡n);单次选择算法也可避免完整排序。训练成本和评分评价另计。

给定校准资料的总体覆盖仍不是给定输入x的覆盖。只有外层失败概率δ所允许的结论可以随资料固定下来,不能据此推出所有输入、所有群组或无限次重新训练都同时合格。

参考资料
  • Vladimir Vovk,Conditional Validity of Inductive Conformal Predictors,PMLR25:475–490,2012,§3,尤其Proposition2b及证明:固定训练后的双层概率保证、精确二项尾和连续/含原子的区别。本文改用“大分数表示异常”的接受方向,重新推导秩下标、Beta密度及样本规模。
关系图谱14 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系