“取 $\alpha=0.4,\delta=0.05,B=1$。$n=4$ 时半径 $\sqrt{\log20/8}\approx0.611937$,前两个动作均不能取得式(4)的证书,只能使…”
预测集合可以不只用“是否盖住真值”评分。例如多标签任务中,漏掉十个真实标签中的一个,比全部漏掉更轻。共形风险控制直接校准这种有界损失,同时保留一个必须说清的概率层次:保证先平均了校准资料,再平均未来损失。
形式陈述
有序有限菜单与安全后备
先固定训练结果、评分方式、参数网格
其中已知
固定
选择第一个满足
本页采用有限网格与全零安全动作,使最小值、终止和失败返回都明确。若损失来自固定规则
这个期望没有固定校准资料。它不声称每次部署的
直觉
经验损失和要面对的新损失相差一个尚未看到的观测。修正项把这个新损失暂按最坏的 B 记入,总数则按 n+1 计算。越宽松的参数使每一条损失都下降,所以这个保守记账会选得不早于一份知道真实新损失的理想规则。
理想规则不能实际部署,但它同时平等地看待 n+1 个观测。其平均损失已经达标,可交换性便把这份平均预算分给每一个位置。证明利用的是函数的逐点单调与对称性,不需要各参数损失独立,也不需要总体风险已知。
例子与边界
多标签漏失比例的可计算菜单
标签有 A、B、C。冻结排序均为 A、B、C,菜单依次输出前一个、前两个、全部三个标签。令真实集合为 Y,损失定义为
四个校准真实集合依次为
经验风险为
这里控制的是“先对每个观测算比例,再平均”。前两个标签总共漏一个,真实标签总数为六,合并计数得到
期望合格,仍可能频繁遇到风险不合格的校准集
考虑只有两个动作。第一个动作的每点损失独立服从Bernoulli(1/2),第二个动作恒为零,故逐点单调。取
令 S 为校准集中第一个动作的总损失。修正条件是
式(1)完全成立,但不能由此声称95%的校准资料都产出风险合格规则。风险控制预测集合把后一种要求单独写成外层失败预算δ。
去掉逐点单调,最坏损失修正也会失效
取
修正条件只在校准损失为零时通过,因此规则会选择第一个出现零的候选。至少一个候选通过的概率为
有界、IID和安全动作都在,缺失的是逐点单调。不能把菜单按经验损失重新排序后补称“现在单调”,因为那个次序已经读过校准资料。
推论与应用
一个对称理想阈值完成证明
在包含真实未来点的 n+1 条损失函数中,定义
安全动作保证集合非空。若实际规则在某个 j 通过,因为
逐点单调给
理想选择只看 n+1 条函数之和,对观测排列不变。因此可交换性使各个
连接两个不等式就是式(1)。若用实测总和而不加 B,实际选择可能早于理想选择;若损失不单调,参数顺序也不能转成损失顺序。两个条件在证明中各有明确责任。
运行与校准资料的使用范围
直接计算整个损失表要
当
损失的定义、标签权重、参数菜单及模型都须在校准前固定,或条件于独立的训练资料后固定。没有已知有限 B 的平方损失、随集合扩大反而上升的错误惩罚、事后挑选最有利损失,都不在当前合同内。选择性分类的“仅在接受者中平均错误”还含随机分母,不能直接用上述漏失比例损失代替。
参考资料
- Anastasios N. Angelopoulos, Stephen Bates, Adam Fisch, Lihua Lei, Tal Schuster,Conformal Risk Control,§2.1 Theorem1及其证明,§2.4非单调风险。本页给可执行的有限网格版本,安全末动作要求加强为零损失;理想阈值比较、交换平均及非单调反例均在正文展开。