形式陈述
普通分割共形 理路 分割共形预测 Split conformal prediction · 分割保形预测 用冻结评分规则的校准秩构造预测集合,并在预先固定群组内分别校准,以获得边际或群组覆盖保证。 依赖校准点与测试点的可交换性。若校准数据来自旧人群,测试点来自新人群,协变量漂移 理路 协变量漂移 Covariate shift · 协变量偏移 · Covariate-shift adaptation 输入人群的组成改变而给定输入的标签机制不变时,以输入密度比把源分布损失转换为目标风险。 仍保留 P ( Y ∣ X ) ,却改变了输入出现频率。此时应改变秩的质量,而非继续把所有位置当作等可能。
条件于独立训练资料及随机种子,冻结实值评分函数 s ( x , y ) ,分数越大表示越不相容。取整数 n ≥ 1 ,校准对 Z 1 , … , Z n 独立同分布于 P S ,未来测试对 Z n + 1 独立来自 P T ;源与目标共用标签条件分布,且 P T X ≪ P S X 。本节先假设知道真实非负密度比 w = d P T X / d P S X ,或其正的共同倍数。选择在源几乎处处有限的版本;输入算法的权重须有限且非负,违反时报告数值或覆盖条件问题。
令 S i = s ( X i , Y i ) 。给定新输入 x ,计算
A ( x ) = ∑ i = 1 n w ( X i ) + w ( x ) , p i ( x ) = w ( X i ) A ( x ) , p ∗ ( x ) = w ( x ) A ( x ) . 在 A ( x ) > 0 时,构造离散概率分布
μ x = ∑ i = 1 n p i ( x ) δ S i + p ∗ ( x ) δ + ∞ . 这里 δ v 是在数值v 上的单位质量。取 μ x 的下侧 ( 1 − α ) 分位数
q ( x ) = inf { u ∈ R ∪ { + ∞ } : μ x ( ( − ∞ , u ] ) ≥ 1 − α } , 0 < α < 1 , 并返回
(1) C ( x ) = { y : s ( x , y ) ≤ q ( x ) } . 在通常的可测性条件下,对校准集和目标测试点共同取概率,有
训 练 资 料 (2) P T { Y n + 1 ∈ C ( X n + 1 ) ∣ 训练资料 } ≥ 1 − α . 这是目标边际 覆盖,不是每个固定x 或每份已实现校准集的条件覆盖。比例权重共同缩放会在分母消去。
直觉
在普通共形中,未来点占 n + 1 个等权位置之一。漂移后,一个更像目标人群的点更可能是未来测试点,它的位置质量应更大。测试点的分数还不知道,因此把它的质量暂放在 + ∞ 上。这个原子不是可有可无的数值补丁,它保留了未来点可能承担的尾部质量。
只把历史残差乘权重再取普通分位数,通常不是式(1)。分数是横轴位置,密度比改变的是这些位置的概率质量。测试点 w ( x ) 也必须进入总质量,所以同一批历史残差对不同新输入可以给出不同阈值。
例子与边界
四个分数的阈值与无穷大
设排序后的校准分数为 ( 0.1 , 0.2 , 0.4 , 0.8 ) ,相应权重为 ( 4 , 2 , 1 , 1 ) 。新输入权重为2,α = 0.3 ,总权重10。四个有限分数处的累计质量依次为
0.4 , 0.6 , 0.7 , 0.8 . 达到0.7的第一个位置是0.4,故 q ( x ) = 0.4 。若评分是 | y − f ^ ( x ) | 且点预测为2,返回 [ 1.6 , 2.4 ] 。不加权普通方法对四个校准点取 ⌈ 5 ⋅ 0.7 ⌉ = 4 阶,阈值是0.8;两者的排序对象不同。
改成新输入权重4,总权重12,全部有限分数质量只有 8 / 12 = 2 / 3 < 0.7 ,故阈值为无穷大,返回整个响应空间。不能随手把它截成最大残差0.8。校准分数全为有限值时,有限阈值恰好要求
(3) ∑ i w ( X i ) A ( x ) ≥ 1 − α ⟺ p ∗ ( x ) ≤ α . 等号时有限质量恰好够,取最后一个有正权的有限分数。这个边界表明:目标点的权重太大时,现有校准资料不足以排除任何响应。
零权重、零分母与覆盖缺口
某些源输入在目标中不再出现,真实 w 可以为零,其校准分数在加权分位数里不占质量。这不违反单向覆盖。目标抽出的测试点却满足 w ( X n + 1 ) > 0 几乎必然,因为 P T X { w = 0 } = ∫ w = 0 w d P S X = 0 ,因此真实目标测试时 A > 0 几乎必然。
对人为查询的目标零质量输入,若分母恰为零,可预先约定返回整个响应空间并标记无法形成局部加权分位数;式(2)并不承诺这个任意固定输入的条件覆盖。源为零而目标有正质量则是另一回事:P T X ≪ P S X 失败,现有标签机制无法由源资料识别,不能用巨大的有限权重补救。
漏掉测试原子的最小反例
即使没有漂移,取 n = 1 , α = 0.1 ,连续无并列分数。若只给一个历史分数归一化,阈值就是该分数,测试分数比它小的概率只有 1 / 2 ,达不到90%。正确算法给历史和无穷大各 1 / 2 质量,90%分位数为无穷大。这个小例已经说明历史加权经验分布不能独自承担覆盖保证。
推论与应用
加权秩的自包含证明
冻结训练资料。暂时忘记 n + 1 个观测的次序,只保留其多重集合。由于一个位置来自 P T 、其余来自 P S ,联合律相对于全源乘积律多出因子 w ( X n + 1 ) 。因此在条件化后的所有可能“谁是测试点”中,第i 个点成为测试点的概率正比于 w ( X i ) ,即
p i = w ( X i ) ∑ j = 1 n + 1 w ( X j ) . 若观测有重复,可先给每个位置附上独立连续辅助标记,使位置可区分;权重只看原输入,随后平均掉辅助标记,不改变算法。
现在这些点的真实分数都固定。令 q 0 为全部有限分数按p i 加权后的 ( 1 − α ) 分位数,故 ∑ i : S i > q 0 p i ≤ α 。如果第i 个点被指定为测试点,算法把该点的质量从 S i 移到无穷大;有限位置的累计质量只会减少,故所得阈值 q i ≥ q 0 。于是
∑ i p i 1 { S i > q i } ≤ ∑ i p i 1 { S i > q 0 } ≤ α . 左边就是给定多重集合后的漏覆盖概率,再对集合取平均便得式(2)。有并列时仍使用非严格接受 S i ≤ q i ,证明不变。这个论证也说明为什么所有来源必须共享同一个冻结评分规则。
独立估计权重会损失多少保证
设非负 w ^ 由额外独立资料拟合,且 0 < c = E S w ^ ( X ) < ∞ 。冻结它后,定义一个假想目标输入分布
d P ~ T X = ( w ^ / c ) d P S X , 并仍共用源标签条件分布。上面的证明对这个假想目标精确成立,因为共同比例c 在分位数中消去。但真实目标是P T 。对同一个事件,两种目标测试律的概率差至多为总变差距离 理路 总变差距离 Total variation distance · TV distance 两个概率分布对最优可测事件所赋概率之差的最大值。 ,所以
训 练 与 权 重 拟 合 资 料 (4) P T { Y ∈ C ( X ) ∣ 训练与权重拟合资料 } ≥ 1 − α − 1 2 E S | w − w ^ c | . 校准集在两种实验中都来自相同源分布,独立乘上同一校准集不会增加这个概率差;共同标签核也使联合总变差等于相应输入总变差。式(4)给出的是误差传递式,若不知道右边权重误差,就没有得到可报的数值保证。
例如二点输入源比例 ( 0.8 , 0.2 ) ,真权重 ( 0.25 , 4 ) ,目标比例 ( 0.2 , 0.8 ) 。若估计权重恒为1,假想目标仍是源,其总变差为0.6。即使要求90%覆盖,式(4)也只保证至少30%。独立拟合不会把错误权重变正确;若连权重都使用了同一批校准或测试资料,这里的冻结与独立证明还须重做。
实现与自测
校准分数计算一次后按分数排序,累计未归一化权重,花 O ( n log n ) 排序及 O ( n ) 空间。新输入计算 w ( x ) 后,只需在累计权重中查找首次达到 ( 1 − α ) ( ∑ i w ( X i ) + w ( x ) ) 的位置;超过有限总量则返回无穷大。二分查找为 O ( log n ) ,基础预测、权重预测和反解集合另计。
将例子中所有权重乘10,区间会改变吗?不会,所有归一化质量不变。
四个历史权重和为8、α = 0.3 ,新权重最大能是多少才有有限阈值?由 u / ( 8 + u ) ≤ 0.3 ,得 u ≤ 24 / 7 ;等号仍有限。
参考资料
Ryan J. Tibshirani, Rina Foygel Barber, Emmanuel J. Candès and Aaditya Ramdas, Conformal Prediction Under Covariate Shift , NeurIPS 2019,§2.1 的式(6)–(7)、Corollary 1、Remark 3,§2.2 的分割版本与估计权重实验;§3 的加权可交换性。本文限定独立训练后的冻结分数,自包含证明分割版本,式(4)为独立权重拟合下的总变差推导。