形式陈述
一个已训练的模型给出点预测,怎样把它变成有覆盖保证的集合?把训练数据 与训练算法的随机种子 合记为训练信息 。先据此拟合预测器公理库预测器与假设类Predictor · Hypothesis class区分可用于预测的函数、函数集合及其参数表示。并选定评分函数 ,分数越大表示候选响应 与输入 越不相容。冻结训练结果及评分规则,另取 个校准对 。
假设给定 后,校准对与将来的测试对 可交换公理库可交换随机变量Exchangeable random variables · Exchangeability · 可交换性从有限坐标置换对称性走到无限 Bernoulli 序列的唯一混合表示,并用矩判断无限延拓的边界。。独立划分的 IID 数据满足此条件。给定目标错误率 ,算法为:
- 计算校准分数 。
- 令 ,将 排序,取第 小值为 。
- 对输入 输出 。
于是对校准数据及新测试对共同取概率,有
这里对几乎每个训练信息 都成立;将训练信息平均掉也得到无条件保证。若分数几乎必然无并列,覆盖恰为 。有并列时仍保留下界,但不能沿用无并列时接近名义水平的上界。
校准阶段若一次评分的成本为 ,按上述排序实现需 时间和 辅助空间。训练成本以及反解集合 的成本另计;一般评分规则未必容易反解。绝对残差评分只需在新输入上计算一次预测,再用常数次运算得到两个区间端点。
直觉
校准集负责测量“这套已经冻结的评分规则会犯多大的错”。把新测试分数也放进来,它与校准分数的地位对称,因此不能总落在最高的少数几个位置。选择阈值就是预先规定允许落在阈值之外的秩数量。
这里的有限样本修正使用 ,因为比较中包含一个尚未看到的新分数。附加的 负责处理校准样本过少、所需秩超过 的情况;它不应被软件随手截成最大校准分数。
分割共形预测的秩阈值与无穷大边界 图中的横向位置表示秩而不是残差间距。上行第八个格子决定有限阈值,下行最后一个格子说明极小校准集可能只能给出整个响应空间。
例子与边界
从九个残差到一个预测区间
回归时取 。设九个校准绝对残差排序后为
若 ,则 ,所以 。新输入上若预测器输出 ,反解
得到 。无需假定残差正态,也无需认为 是正确条件均值;预测器不好时区间可能很宽,覆盖保证并不保证有用的宽度。
若只有 个校准点而要求 覆盖,,阈值就是 。绝对残差评分于是返回 。若擅自改用最大校准残差,无并列情形覆盖只有 ,达不到 。
覆盖的概率究竟对谁取
这是对未来响应 的预测集合,不是关于固定总体参数的抽样置信区间公理库置信区间Confidence interval · Confidence set以重复抽样覆盖率校准参数区间,并从正态枢轴与二项等尾检验反演算出有限样本端点。。例如均值置信区间随着样本增加可以很窄,但单个新响应仍有自身噪声,两种区间的目标和随机性不同。置信序列公理库置信序列Confidence sequence · Anytime-valid confidence sequence · 时间一致置信序列一列随数据更新的随机置信集合,以规定概率在所有时间同时覆盖同一个固定参数目标。进一步要求同一个固定参数在所有时间同时被覆盖;本页对一个未来响应的边际覆盖不能直接推出这种全时间事件。
边际覆盖平均了校准集和测试对的随机性。它不保证每个固定 都有 条件覆盖,也不保证每份已经固定的校准集都达到该比例。若容易预测的群体占 ,困难群体占 ,一个程序可能在前者覆盖全部、后者全部漏掉,整体仍有 覆盖;仅给出整体数字不能排除这种分配。
若用同一校准集反复选择评分函数、调参再报告普通阈值,训练和校准的角色已混淆,上述冻结条件不再自动满足。时间漂移或按结果选择测试数据也可能破坏可交换性,需要另行适用的保证。
推论与应用
秩证明
给定训练信息, 可交换。先假设无并列,则测试分数的秩均匀分布于 。当 时,事件 等价于测试分数在这 个真实分数中的秩不超过 ,故概率为 ;当 时阈值为无穷大,覆盖概率为一。
有并列时,给各分数附上随机数 ;这些随机数相互独立、均服从 ,且整个随机数向量独立于原始数据、训练信息及分数向量。按“分数、随机数”作字典序排序,测试秩仍均匀。随机打破并列后秩不超过 的事件包含在原来使用 的覆盖事件中,因而原覆盖不会更小。这解释了为何下界稳定,而上界需要排除或随机处理并列。
若希望历史数据全部参与拟合,全共形预测公理库全共形预测Full conformal prediction · Transductive conformal prediction · 全保形预测把候选响应加入数据后对称地重新拟合,以全部分数的秩检验候选值,在可交换性下构造有限样本预测集合。对每个候选响应增广数据并对称重拟合,使候选点与历史点共同接受评分;覆盖仍来自可交换秩,但历史分数及阈值都随候选改变。
分类问题可用 ,输出所有分数不超过阈值的标签;不要求这些模型概率本身已校准。回归也可用按输入尺度归一化的残差,让集合宽度随 改变,但尺度估计和评分规则仍应在校准前冻结。评分选择影响集合效率,可交换秩负责覆盖,两个任务应分别检查。
预先固定群组:分别校准而非只看总体平均
若希望指定人群分别获得覆盖,可以让每个人群使用自己的校准秩。这里额外采用条件 IID 设定:给定训练信息 ,校准对和测试对是同一分布的独立样本公理库独立同分布样本IID sample · Independent and identically distributed sample以乘积分布描述来自同一总体的独立重复观测。。在接触校准数据之前,冻结评分函数与可测分组函数
分组可以由独立训练集拟合,例如按预训练难度模型将输入分层;预测时只需输入 就能知道其组别。校准残差不能反过来参与选择这份划分,否则下述组内对称性证明需要重新建立。
记第 组的校准索引、数量和所需秩为
把该组分数 与一个 排序,取第 小值 。对新输入返回
算法对空组也有明确输出: 时列表只有 ,,集合就是整个响应空间。更一般地,有限实值阈值的条件是
因此细分人群会减少每组可用的校准量;这会直接影响区间宽度和有限阈值是否存在。
组内覆盖的证明与一个稀有人群
固定训练信息后,先条件于全部校准输入的组别向量以及测试组别为 。由 IID 条件,该组的 个校准对与测试对都来自同一组内条件分布,且独立,因此其 个分数可交换。对这些分数应用前面的秩证明,无并列时覆盖为 ,有并列时至少达到这个值; 时覆盖为一。
再平均掉具有同一组内数量的各种组别向量,得到对条件事件有正概率的 ,
继续平均 就得到该组的覆盖保证。证明仍对组内校准分数和测试点共同取概率,并没有固定住一份已实现的校准集。它也只条件于整个组,不能进一步无条件地改成每个固定 的覆盖。
例如取 。A 组有七个排序后的绝对残差
故 ,。该组新输入的预测值若为 ,返回 。B 组只有两个校准点,则 ,只能取附加的无穷大。把两个组混在一起计算一个有限阈值,可能仍保住总体覆盖,却没有上述分别保护稀有组的证明。
这种按组计算属于 Mondrian 共形思想的一种输入分组版本。若组别取决于候选标签 ,预测时必须对每个候选 分别确定其组别和阈值;不能提前使用未知的真实标签。另一方面,互相重叠的多个群组并不是这里的固定划分,也不能直接共享同一个组内排序证明。
一次评分后可按组收集分数并分别排序,总排序成本为 ;额外记录每组阈值需 空间。评分、分组和反解预测集的成本应按实际模型另外核算。
自测
设 ,应选择哪个秩?答案为 ;无并列时覆盖为 。若全部校准及测试分数都相同,仍使用非严格不等式,覆盖是多少?答案为一;因此不能在有并列时宣称覆盖恰为 。
参考资料