形式陈述
协变量漂移 理路 协变量漂移 Covariate shift · 协变量偏移 · Covariate-shift adaptation 输入人群的组成改变而给定输入的标签机制不变时,以输入密度比把源分布损失转换为目标风险。 的评价公式需要 w ( x ) = p T ( x ) / p S ( x ) ,实际通常只有两批输入样本。可以给它们添加“来自哪里”的标签,转成概率分类问题,而不分别估计两个高维密度。
构造辅助来源变量 D ∈ { 0 , 1 } :D = 0 表示源,D = 1 表示目标。选定混合先验 P ( D = 1 ) = ρ ∈ ( 0 , 1 ) ,条件输入分布分别为 P S X , P T X 。记
e ( x ) = P ( D = 1 ∣ X = x ) . 由Bayes公式 理路 Bayes 定理 Bayes' theorem · Bayes' rule 用先验与证据在各假设下的可能性反转条件方向,得到归一化后验。 ,在源密度为正处,
(1) e ( x ) = ρ p T ( x ) ( 1 − ρ ) p S ( x ) + ρ p T ( x ) , w ( x ) = 1 − ρ ρ e ( x ) 1 − e ( x ) . 若 P T X ≪ P S X ,可改用相对于 P S X 的密度写同一证明。源几乎处处的真实 e < 1 ;目标有质量而源为零的区域没有有限密度比,来源分类也不能修复这一覆盖缺口。
算法先冻结取样比例、来源标签方向和训练损失,再拟合概率模型 e ^ ,最后按式(1)转为 w ^ 。直接混合 n S 个源点与n T 个目标点、给予所有点同等来源分类权重时,对应 ρ = n T / ( n S + n T ) 。若做类别重采样或加权训练,应使用分类器实际拟合的混合先验;原文件中的行数比例未必仍是正确的 ρ 。
输出需保存来源模型、实际先验、概率裁剪规则以及估计权重。辅助标签D 不等于原任务标签Y ;来源容易分类,只说明输入分布不同,并未检验共同 P ( Y ∣ X ) 。
直觉
某种输入在目标样本里很常见、源样本里罕见,它更容易被来源分类器认作目标。将这个后验概率转成赔率,再除去我们自己设定的来源先验赔率,就恢复两个人群的相对出现频率。
分类器需要输出有概率意义的数,而不仅是“源或目标”。将0.51改成0.99,来源类别都仍判为目标,但赔率从约1变成99;同样的分类正确率可以对应完全不同的风险权重。
例子与边界
不平衡来源样本的精确换算
沿用两个人群:源的 P S ( X = 0 ) = 4 / 5 、P S ( X = 1 ) = 1 / 5 ;目标反过来为 1 / 5 , 4 / 5 。取两倍于目标数量的源样本,故 ρ = 1 / 3 。准确的来源后验为
e ( 0 ) = 1 / 9 , e ( 1 ) = 2 / 3. 式(1)的先验系数是2,因此
w ( 0 ) = 2 1 / 9 8 / 9 = 1 / 4 , w ( 1 ) = 2 2 / 3 1 / 3 = 4. 两层条件错误率分别为 1 / 10 , 9 / 10 时,目标风险为
4 5 1 4 1 10 + 1 5 ⋅ 4 ⋅ 9 10 = 37 50 = 0.74 . 若漏掉先验系数2,权重整体少一半,普通加权均值会趋于0.37。把样本权重再归一化可能消掉这次共同倍数错误,但已经换成比率估计;它不能保证修复随输入变化的权重误差。
若估得 e ^ ( 0 ) = 1 / 10 , e ^ ( 1 ) = 3 / 5 ,则 w ^ = ( 2 / 9 , 3 ) ,加权风险的总体极限变为
4 5 2 9 1 10 + 1 5 ⋅ 3 ⋅ 9 10 = 251 450 ≈ 0.55778 , 偏差为 − 41 / 225 ≈ − 0.18222 。即使独立评价样本无限多,也只会更准确地估计这个错误权重下的量。
来源概率总体校准也可能不够
永远报 e ^ = ρ = 1 / 3 的来源模型,确实满足总体概率校准 理路 概率校准与可靠度 Probability calibration · Reliability diagram 用条件正例率等于报告概率定义概率校准,计算可靠度与分箱误差,并区分校准、边际均值、分类一致性和分辨力。 :所有点被放进同一个分数档,该档的目标比例就是1/3。但它给出的权重恒为1,完全丢掉本例的输入组成变化。
因此需要的是足够准确的 e ( x ) ,或能控制所关心风险的密度比误差;粗分数的总体校准不能替代输入层面的后验拟合。来源模型的可靠度、分辨力和分布覆盖要分别检查。
接近一时的非线性放大
对固定 ρ ,令 c = ( 1 − ρ ) / ρ 。直接通分可得
(2) | w ^ − w | = c | e ^ − e | ( 1 − e ^ ) ( 1 − e ) . 若真实和估计来源概率都不超过 1 − ε ,则 | w ^ − w | ≤ c ε − 2 | e ^ − e | 。这是有分母下界时的稳定性,不是全空间自动成立的常数。
例如 ρ = 1 / 2 ,e = 0.99 给 w = 99 ,e ^ = 0.98 给 w ^ = 49 ;概率只差0.01,权重却差50。把概率裁剪到0.95会将权重压到19,降低波动但引入额外截断误差。不能用裁剪后的有界性宣称真实权重本来有界。
推论与应用
独立风险评价的误差账本
设原任务模型 h 及来源模型 e ^ 由其他资料拟合并冻结;另有 n ≥ 1 个与上述拟合资料独立、来自源分布的IID验证样本 Z 1 , … , Z n 。假设 0 ≤ L h ≤ 1 ,以及实际返回的 0 ≤ w ^ ≤ W < ∞ 。定义 P n f = n − 1 ∑ i f ( Z i ) 。条件于全部拟合结果,恒等分解为
(3) P n ( w ^ L h ) − R T ( h ) = ( P n − P S ) ( w ^ L h ) + P S [ ( w ^ − w ) L h ] . 第一项是验证抽样误差。对取值区间 [ 0 , W ] 使用Hoeffding不等式 理路 Hoeffding 不等式 Hoeffding's inequality 独立有界随机变量和偏离期望的概率以平方偏差的指数速度衰减。 ;第二项用 L h ≤ 1 。对 0 < δ < 1 ,以至少 1 − δ 的条件概率,
(4) | P n ( w ^ L h ) − R T ( h ) | ≤ W log ( 2 / δ ) 2 n + E S | w ^ − w | . 若有独立理论或证据保证最后一项至多 ϵ w ,才能把它换成可报告的数值界;单看当前权重的直方图并不能知道该项。若该误差保证本身仅以概率 1 − δ w 成立,则用并集界将总失败概率记为 δ + δ w 。
本例错误权重的 L 1 ( P S ) 误差为
4 5 | 2 9 − 1 4 | + 1 5 | 3 − 4 | = 2 9 , 确实大于实际风险偏差 41 / 225 。取 W = 3 , n = 10000 , δ = 0.05 ,抽样半径约0.04074;仅有这份粗权重证据时,总上界仍约0.26297。增大验证集只会缩小第一项。
数据复用与下一步选择
独立拟合权重不会自动消除其偏差,但允许式(3)中清楚地区分两类误差。若权重分类器见过这些验证输入,即使没有见到任务标签,w ^ ( X i ) 也依赖评价样本,不能原样使用条件IID的证明。可重新划分资料,或构造逐折交叉拟合并分别分析每个折;交叉拟合不会凭空证明权重准确。
用估计权重调参时,权重学习也属于被评价的整体流程 理路 嵌套交叉验证的执行协议 Nested cross-validation protocol · Nested model evaluation protocol 对重复实体资料逐层隔离拟合、校准、调参与评价,完整复算内层选择、外层损失和实际拟合次数。 。若只想修正预测集合的覆盖,加权分割共形 理路 协变量漂移下的加权分割共形 Weighted split conformal prediction · Covariate-shift weighted conformal 将源校准分数与测试点的无穷大原子按密度比加权,证明目标边际覆盖,并用总变差量化独立估计权重的偏差。 还需要测试点自身的权重和相应秩构造;风险加权平均并不等于覆盖修正。
来源分类的训练成本取决于实际模型,不能只报一个统一线性复杂度。训练后,对每个验证点进行一次来源概率预测、一次赔率换算和一次任务损失计算;若有 n 个验证点,纯汇总是 O ( n ) ,内存可逐点累计。
自测与答案
训练来源分类器时将两类重采样到等大,该用哪个先验?用实际平衡目标的 ρ = 1 / 2 ,并确认输出概率确实对应它;不能继续按原文件数量换算。
保持 e ^ 不变,把独立验证样本增大100倍,式(4)哪项缩小?抽样项缩小10倍,权重偏差项不变。
参考资料