形式陈述
一个已训练的模型给出点预测,怎样把它变成有覆盖保证的集合?把训练数据 与训练算法的随机种子 合记为训练信息 。先据此拟合预测器公理库预测器与假设类Predictor · Hypothesis class区分可用于预测的函数、函数集合及其参数表示。并选定评分函数 ,分数越大表示候选响应 与输入 越不相容。冻结训练结果及评分规则,另取 个校准对 。
假设给定 后,校准对与将来的测试对 可交换公理库可交换随机变量Exchangeable random variables · Exchangeability · 可交换性联合分布在任意有限坐标置换下保持不变的对称性,不要求各坐标独立。。独立划分的 IID 数据满足此条件。给定目标错误率 ,算法为:
- 计算校准分数 。
- 令 ,将 排序,取第 小值为 。
- 对输入 输出 。
于是对校准数据及新测试对共同取概率,有
这里对几乎每个训练信息 都成立;将训练信息平均掉也得到无条件保证。若分数几乎必然无并列,覆盖恰为 。有并列时仍保留下界,但不能沿用无并列时接近名义水平的上界。
校准阶段若一次评分的成本为 ,按上述排序实现需 时间和 辅助空间。训练成本以及反解集合 的成本另计;一般评分规则未必容易反解。绝对残差评分只需在新输入上计算一次预测,再用常数次运算得到两个区间端点。
直觉
校准集负责测量“这套已经冻结的评分规则会犯多大的错”。把新测试分数也放进来,它与校准分数的地位对称,因此不能总落在最高的少数几个位置。选择阈值就是预先规定允许落在阈值之外的秩数量。
这里的有限样本修正使用 ,因为比较中包含一个尚未看到的新分数。附加的 负责处理校准样本过少、所需秩超过 的情况;它不应被软件随手截成最大校准分数。
分割共形预测的秩阈值与无穷大边界 图中的横向位置表示秩而不是残差间距。上行第八个格子决定有限阈值,下行最后一个格子说明极小校准集可能只能给出整个响应空间。
例子与边界
从九个残差到一个预测区间
回归时取 。设九个校准绝对残差排序后为
若 ,则 ,所以 。新输入上若预测器输出 ,反解
得到 。无需假定残差正态,也无需认为 是正确条件均值;预测器不好时区间可能很宽,覆盖保证并不保证有用的宽度。
若只有 个校准点而要求 覆盖,,阈值就是 。绝对残差评分于是返回 。若擅自改用最大校准残差,无并列情形覆盖只有 ,达不到 。
覆盖的概率究竟对谁取
这是对未来响应 的预测集合,不是关于固定总体参数的抽样置信区间公理库置信区间Confidence interval · Confidence set以重复抽样覆盖率校准参数区间,并从正态枢轴与二项等尾检验反演算出有限样本端点。。例如均值置信区间随着样本增加可以很窄,但单个新响应仍有自身噪声,两种区间的目标和随机性不同。置信序列公理库置信序列Confidence sequence · Anytime-valid confidence sequence · 时间一致置信序列一列随数据更新的随机置信集合,以规定概率在所有时间同时覆盖同一个固定参数目标。进一步要求同一个固定参数在所有时间同时被覆盖;本页对一个未来响应的边际覆盖不能直接推出这种全时间事件。
边际覆盖平均了校准集和测试对的随机性。它不保证每个固定 都有 条件覆盖,也不保证每份已经固定的校准集都达到该比例。若容易预测的群体占 ,困难群体占 ,一个程序可能在前者覆盖全部、后者全部漏掉,整体仍有 覆盖;仅给出整体数字不能排除这种分配。
若用同一校准集反复选择评分函数、调参再报告普通阈值,训练和校准的角色已混淆,上述冻结条件不再自动满足。时间漂移或按结果选择测试数据也可能破坏可交换性,需要另行适用的保证。
推论与应用
秩证明
给定训练信息, 可交换。先假设无并列,则测试分数的秩均匀分布于 。当 时,事件 等价于测试分数在这 个真实分数中的秩不超过 ,故概率为 ;当 时阈值为无穷大,覆盖概率为一。
有并列时,给各分数附上随机数 ;这些随机数相互独立、均服从 ,且整个随机数向量独立于原始数据、训练信息及分数向量。按“分数、随机数”作字典序排序,测试秩仍均匀。随机打破并列后秩不超过 的事件包含在原来使用 的覆盖事件中,因而原覆盖不会更小。这解释了为何下界稳定,而上界需要排除或随机处理并列。
若希望历史数据全部参与拟合,全共形预测公理库全共形预测Full conformal prediction · Transductive conformal prediction · 全保形预测把候选响应加入数据后对称地重新拟合,以全部分数的秩检验候选值,在可交换性下构造有限样本预测集合。对每个候选响应增广数据并对称重拟合,使候选点与历史点共同接受评分;覆盖仍来自可交换秩,但历史分数及阈值都随候选改变。
分类问题可用 ,输出所有分数不超过阈值的标签;不要求这些模型概率本身已校准。回归也可用按输入尺度归一化的残差,让集合宽度随 改变,但尺度估计和评分规则仍应在校准前冻结。评分选择影响集合效率,可交换秩负责覆盖,两个任务应分别检查。
自测
设 ,应选择哪个秩?答案为 ;无并列时覆盖为 。若全部校准及测试分数都相同,仍使用非严格不等式,覆盖是多少?答案为一;因此不能在有并列时宣称覆盖恰为 。
参考资料