“若关心一份已经固定的校准资料将来会覆盖多少,校准资料条件覆盖会对随机阈值诱导的总体覆盖率再给一个外层概率界。这个要求与群组覆盖仍不同。”
一套方法平均能覆盖80%的未来响应,不意味着拿到任意一份校准资料后,它的真实覆盖率都至少80%。本页固定训练模型,把校准资料本身当作外层随机性,直接计算不同校准结果之间的覆盖波动,并据此选择阈值。
形式陈述
内层是未来覆盖,外层是校准资料
条件于独立的训练资料,冻结可测实值评分
其中
这里的条件概率固定了整份校准资料,但仍平均未来输入和响应。若F连续,则
即参数
对预定目标
所以选最小的 k,使式(3)不超过δ,就有
若没有有限 k 满足条件,则取
直觉
标准秩校准关注一次未来点是否进入集合。这里则问:固定这次已经校准出的集合规则,未来总体有多大一部分会进入它?这是一个介于零与一之间的数,但换一批校准资料,这个数就会变化。
分数阈值 Q 本身带着原响应单位,可能很难分析。把它送入真实分布函数F,得到的是“分数总体在阈值下方占多少质量”,恰好就是条件覆盖率。连续分布下,概率坐标的每一个样本都均匀,故覆盖波动只由 n 和 k 决定,不由评分单位决定。
Beta密度并不需要先假设参数模型
当F连续时,
F单调使
对这个多项式求导,相邻项望远镜消去,得到式(2)。其均值、二阶矩可分别对
相减即得方差。将
例子与边界
平均80%覆盖,却有40.96%的校准资料达不到80%
取
可直接看这个事件:四个校准分数都落在总体最低的80%范围里,于是它们的最大值仍没到80%分位。名义边际覆盖没有出错,只是它没有承诺“95%的校准资料都达到80%”。
若要求后一份合同,
图中横轴v是部署规则的总体覆盖水平,左图纵轴才是校准资料产生不足覆盖的概率;右图另列平均覆盖,避免把这两个数当成一个。
二项认证何时允许有限阈值
按式(3)的分布无关二项认证规则,对固定 n,上界随 k 增大而下降;有限秩中最保守的是 k=n,其二项尾为
连续F时二项尾就是精确失败概率,式(5)也成为当前有限秩程序达到式(4)的必要条件。离散F可能更早达标,例如后文的恒零分数;不能把这条门槛解释成每个固定总体都必需的样本数。
按上述二项认证,要求95%的校准资料达到80%覆盖,最少需14个校准观测:
有更多资料时,可按式(3)选择较小秩,得到更紧的嵌套接受集合。这个秩由 n、α、δ预先算出,不需读取校准分数的实际大小。
离散分数:保留非严格接受,不硬套连续密度
若
一般地,给每个分数配一个独立均匀变量V,令
这个变换把每个原子的质量均匀铺在其对应CDF跳跃区间;连续部分按F映射,因此
右端仍是式(3)的二项尾。辅助V仅用于证明这个耦合,不要求实际随机化接受规则。若把非严格接受改成严格
推论与应用
与分位置信区间的工具共享与输出区别
分布无关分位置信区间也是把固定总体分位是否落在样本次序统计量之间,化成一个二项计数。本页用同一计数接口规划一个随机部署规则,使它在好校准资料上的未来覆盖率达标。报告时应同时给出 n、k、α、δ和接受规则,不能只写一个“置信水平”。
这也是高概率风险校准在零一漏覆盖损失上的一种精确秩实现,但本页额外利用冻结评分的嵌套水平集与连续分数分布。算法或目标存在联系,并不意味着可以不加条件地套用任何风险上界。
数据使用和计算边界
式(1)用到未来分数在给定校准资料后仍服从F,这是IID及独立训练的作用。只有有限可交换性时,未来条件分布可能随D改变,不能直接写成同一个F(Q)。分割共形的边际保证仍可能成立,但本页的Beta与二项计算不能照搬。
同一批校准资料上试多个评分函数、分位模型或秩,再选择最窄结果,会把所选对象变成数据依赖菜单。每个固定对象的式(4)并不自动成为选择后的保证,应另用独立选择资料或同时校正。
可先从 k=n 向下累加二项质量,找最后一个仍满足δ的秩;n项递推即为
给定校准资料的总体覆盖仍不是给定输入x的覆盖。只有外层失败概率δ所允许的结论可以随资料固定下来,不能据此推出所有输入、所有群组或无限次重新训练都同时合格。
参考资料
- Vladimir Vovk,Conditional Validity of Inductive Conformal Predictors,PMLR25:475–490,2012,§3,尤其Proposition2b及证明:固定训练后的双层概率保证、精确二项尾和连续/含原子的区别。本文改用“大分数表示异常”的接受方向,重新推导秩下标、Beta密度及样本规模。