Skip to content

算法Algorithm

分割共形预测

Split conformal prediction · 分割保形预测

用独立于拟合过程的校准分数秩构造预测集合,在可交换性下保证新响应的有限样本边际覆盖。

形式陈述 ​

一个已训练的模型给出点预测,怎样把它变成有覆盖保证的集合?把训练数据 T 与训练算法的随机种子 ξ 合记为训练信息 T=(T,ξ)。先据此拟合预测器并选定评分函数 sT(x,y)∈R,分数越大表示候选响应 y 与输入 x 越不相容。冻结训练结果及评分规则,另取 n≥1 个校准对 (Xi,Yi)。

假设给定 T 后,校准对与将来的测试对 (Xn+1,Yn+1) 可交换。独立划分的 IID 数据满足此条件。给定目标错误率 0<α<1,算法为:

  1. 计算校准分数 Si=sT(Xi,Yi)。
  2. 令 k=⌈(n+1)(1−α)⌉,将 S1,…,Sn,+∞ 排序,取第 k 小值为 q^。
  3. 对输入 x 输出 C(x)={y:sT(x,y)≤q^}。

于是对校准数据及新测试对共同取概率,有

P{Yn+1∈C(Xn+1)∣T}≥1−α.

这里对几乎每个训练信息 T 都成立;将训练信息平均掉也得到无条件保证。若分数几乎必然无并列,覆盖恰为 k/(n+1)。有并列时仍保留下界,但不能沿用无并列时接近名义水平的上界。

校准阶段若一次评分的成本为 cs,按上述排序实现需 O(ncs+nlog⁡n) 时间和 O(n) 辅助空间。训练成本以及反解集合 {y:sT(x,y)≤q^} 的成本另计;一般评分规则未必容易反解。绝对残差评分只需在新输入上计算一次预测,再用常数次运算得到两个区间端点。

直觉

校准集负责测量“这套已经冻结的评分规则会犯多大的错”。把新测试分数也放进来,它与校准分数的地位对称,因此不能总落在最高的少数几个位置。选择阈值就是预先规定允许落在阈值之外的秩数量。

这里的有限样本修正使用 n+1,因为比较中包含一个尚未看到的新分数。附加的 +∞ 负责处理校准样本过少、所需秩超过 n 的情况;它不应被软件随手截成最大校准分数。

分割共形预测的秩阈值与无穷大边界

图中的横向位置表示秩而不是残差间距。上行第八个格子决定有限阈值,下行最后一个格子说明极小校准集可能只能给出整个响应空间。

例子与边界

从九个残差到一个预测区间 ​

回归时取 sT(x,y)=|y−f^T(x)|。设九个校准绝对残差排序后为

0.1,0.2,0.3,0.4,0.5,0.6,0.7,0.8,1.5.

若 α=0.2,则 k=⌈10⋅0.8⌉=8,所以 q^=0.8。新输入上若预测器输出 f^T(x)=2.3,反解

|y−2.3|≤0.8

得到 C(x)=[1.5,3.1]。无需假定残差正态,也无需认为 f^T 是正确条件均值;预测器不好时区间可能很宽,覆盖保证并不保证有用的宽度。

若只有 n=4 个校准点而要求 90% 覆盖,k=⌈5⋅0.9⌉=5,阈值就是 +∞。绝对残差评分于是返回 R。若擅自改用最大校准残差,无并列情形覆盖只有 4/5,达不到 0.9。

覆盖的概率究竟对谁取 ​

这是对未来响应 Yn+1 的预测集合,不是关于固定总体参数的抽样置信区间。例如均值置信区间随着样本增加可以很窄,但单个新响应仍有自身噪声,两种区间的目标和随机性不同。置信序列进一步要求同一个固定参数在所有时间同时被覆盖;本页对一个未来响应的边际覆盖不能直接推出这种全时间事件。

边际覆盖平均了校准集和测试对的随机性。它不保证每个固定 x 都有 1−α 条件覆盖,也不保证每份已经固定的校准集都达到该比例。若容易预测的群体占 90%,困难群体占 10%,一个程序可能在前者覆盖全部、后者全部漏掉,整体仍有 90% 覆盖;仅给出整体数字不能排除这种分配。

若用同一校准集反复选择评分函数、调参再报告普通阈值,训练和校准的角色已混淆,上述冻结条件不再自动满足。时间漂移或按结果选择测试数据也可能破坏可交换性,需要另行适用的保证。

推论与应用

秩证明 ​

给定训练信息,S1,…,Sn+1 可交换。先假设无并列,则测试分数的秩均匀分布于 1,…,n+1。当 k≤n 时,事件 Sn+1≤q^ 等价于测试分数在这 n+1 个真实分数中的秩不超过 k,故概率为 k/(n+1)≥1−α;当 k=n+1 时阈值为无穷大,覆盖概率为一。

有并列时,给各分数附上随机数 Ui;这些随机数相互独立、均服从 Uniform(0,1),且整个随机数向量独立于原始数据、训练信息及分数向量。按“分数、随机数”作字典序排序,测试秩仍均匀。随机打破并列后秩不超过 k 的事件包含在原来使用 ≤q^ 的覆盖事件中,因而原覆盖不会更小。这解释了为何下界稳定,而上界需要排除或随机处理并列。

若希望历史数据全部参与拟合,全共形预测对每个候选响应增广数据并对称重拟合,使候选点与历史点共同接受评分;覆盖仍来自可交换秩,但历史分数及阈值都随候选改变。

分类问题可用 sT(x,y)=1−p^T(y∣x),输出所有分数不超过阈值的标签;不要求这些模型概率本身已校准。回归也可用按输入尺度归一化的残差,让集合宽度随 x 改变,但尺度估计和评分规则仍应在校准前冻结。评分选择影响集合效率,可交换秩负责覆盖,两个任务应分别检查。

自测 ​

设 n=19,α=0.1,应选择哪个秩?答案为 k=18;无并列时覆盖为 18/20=0.9。若全部校准及测试分数都相同,仍使用非严格不等式,覆盖是多少?答案为一;因此不能在有并列时宣称覆盖恰为 0.9。

参考资料
关系图谱9 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系