形式陈述
协变量漂移区分两个分布:有标签数据来自源分布 P S ,部署表现按目标分布 P T 评价。它假设输入 X 的出现频率可以改变,但给定同一个输入后,标签 Y 的生成机制保持不变。例如,新旧月份邮件中不同发件域的比例可以变化,而每一种已记录的邮件特征所对应的垃圾邮件概率保持不变。这项条件不变性是模型假设,不能仅由“训练集和部署集不同”推出。
共同标签机制与覆盖条件
严格地,取标准 Borel 输入空间 X 与标签空间 Y ,以保证可以使用正则条件分布 公理库 条件分布 Conditional distribution · Regular conditional distribution 给定观测值后随机量的概率律,以及它与原联合分布相容的核表示。 。设存在同一个概率核 K ,使
P j ( d x , d y ) = P j X ( d x ) K ( x , d y ) , j ∈ { S , T } . 这里 K ( x , B ) 是给定 X = x 后标签落入 B 的概率。共用 K 表示整个条件标签分布不变;在回归中,只要求条件均值相同一般不够,因为损失还可能依赖条件方差或更高阶信息。条件分布本来只在对应边缘分布的几乎处处意义下确定;共同核要求存在相容的版本,而不是要求零概率输入处任意选出的版本也逐点一致。
为了从源数据识别目标风险,再要求目标输入分布相对于源输入分布绝对连续 公理库 测度的绝对连续 Absolute continuity of measures 当一个测度的零集必为另一个测度的零集时成立的支配关系。 :
P T X ≪ P S X , w ( x ) = d P T X d P S X ( x ) . 方向不能颠倒:源分布赋予零概率的输入集合,目标分布也必须赋予零概率。源数据可以包含部署时不再出现的人群,此时相应权重是零。条件并不要求两边的支持完全相同,更不保证 w 有界;有密度时,它就是目标密度与源密度之比。
目标风险的加权恒等式
固定一个可测预测器 h ,令 L h ( x , y ) = ℓ ( h ( x ) , y ) ≥ 0 ,并用共同标签核定义条件平均损失
m h ( x ) = ∫ L h ( x , y ) K ( x , d y ) . 则目标总体风险 公理库 损失函数与总体风险 Loss function · Population risk · Expected risk 损失刻画一次决策的代价,总体风险是未知分布下的平均代价。 满足
R T ( h ) = E P T [ L h ( X , Y ) ] = E P S [ w ( X ) L h ( X , Y ) ] . 证明只需把两层平均分开。先对同一输入处的标签取平均,再改变输入的积分测度:
R T ( h ) = ∫ m h ( x ) P T X ( d x ) = ∫ w ( x ) m h ( x ) P S X ( d x ) = ∫ ∫ w ( x ) L h ( x , y ) K ( x , d y ) P S X ( d x ) = E P S [ w ( X ) L h ( X , Y ) ] . 第二步使用输入分布的 Radon–Nikodym 导数,第三步使用共同核与非负积分的迭代规则。因此联合分布的换测度权重也只依赖 x ,即 d P T / d P S ( x , y ) = w ( x ) 。对非负损失,恒等式允许两边同为无穷;若要估计一个有限风险,则须另加可积性。允许带符号损失时,可用绝对可积性保证同一推导成立。
独立源验证集上的估计
设 ( X i , Y i ) i = 1 n 是与 h 独立的源分布IID 样本 公理库 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 ,并且使用精确权重 w 。若 E S [ w L h ] < ∞ ,定义
R ^ T ( h ) = 1 n ∑ i = 1 n w ( X i ) L h ( X i , Y i ) . 每一项的期望由上式等于 R T ( h ) ,所以线性性给出 E [ R ^ T ( h ) ] = R T ( h ) ;大数定律 公理库 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 又给出 R ^ T ( h ) → R T ( h ) 几乎必然。这是重要性采样 公理库 重要性采样 Importance sampling · 重要抽样 从易采样的提议分布取样,以目标和提议的密度比修正访问频率并估计目标积分。 在学习风险评价中的具体应用。若二阶矩有限,样本独立还给出
Var ( R ^ T ( h ) ) = E S [ w ( X ) 2 L h ( X , Y ) 2 ] − R T ( h ) 2 n . 无偏、一致和有限方差是三件事;前两项并不自动带来第三项。
直觉
把输入空间想成不同人群。源数据告诉我们每个人群内部的错误率,但源总体错误率使用的是旧人群比例。部署人群比例改变时,内部错误率即使完全不变,汇总结果也会改变。密度比 w 正好把旧比例乘成新比例:目标中更常见的人群获得更大权重,目标中减少的人群获得更小权重。
权重并没有创造新标签。它的有效性依赖两座桥:源数据必须覆盖目标需要的人群,而这些人群内部的标签机制必须可从源迁移到目标。第一座桥由绝对连续性保证,第二座桥由共同条件核保证。两者成立时,剩下的是平均方式的改变;其中任何一项失败,仅调整输入权重都不能保证恢复目标风险。
图片加载失败 输入比例变化与风险排序反转
例子与边界
两个人群让模型排序反转
令 X , Y ∈ { 0 , 1 } ,采用 0–1 损失。分布与权重如下;每一行的条件标签概率在源和目标中相同。
输入层
源比例 P S ( X = x )
目标比例 P T ( X = x )
K ( x , { 1 } )
权重 w ( x )
x = 0
4 / 5
1 / 5
1 / 10
1 / 4
x = 1
1 / 5
4 / 5
9 / 10
4
先看总是预测零的 h 0 。它恰在 Y = 1 时出错,因此
R S ( h 0 ) = 4 5 1 10 + 1 5 9 10 = 13 50 = 0.26 , R T ( h 0 ) = 1 5 1 10 + 4 5 9 10 = 37 50 = 0.74 . 总是预测一的 h 1 在每个样本上的错误指示量与 h 0 互补,所以 R S ( h 1 ) = 0.74 ,R T ( h 1 ) = 0.26 。源分布偏爱 h 0 ,目标分布偏爱 h 1 。标签机制没有变化,但在只允许这两个常数规则的假设类里,最优预测器变了。
使用源分布和权重,确实恢复目标风险:
E S [ w L h 0 ] = 4 5 1 4 1 10 + 1 5 ⋅ 4 ⋅ 9 10 = 0.02 + 0.72 = 0.74 . 这里稀少的 x = 1 源样本承载了大部分目标风险。代价可以精确算出。因为 0–1 损失满足 L h 0 2 = L h 0 ,
E S [ ( w L h 0 ) 2 ] = 4 5 ( 1 4 ) 2 1 10 + 1 5 ⋅ 4 2 ⋅ 9 10 = 577 200 = 2.885 , Var ( R ^ T ( h 0 ) ) = 2.885 − 0.74 2 n = 2.3374 n . 若能直接取得同样大小的目标 IID 验证集,平均错误率的方差则是 0.74 × 0.26 / n = 0.1924 / n 。这个例子的源加权评价约有其 12.15 倍方差。无偏说的是重复采样的平均值正确,不是说一份有限验证集会准确,也不是说加权必然比目标采样更省数据。
条件机制改变时,精确权重也会失效
保留上表的源分布和两边输入比例,只把目标正标签概率改为 K T ( 0 , { 1 } ) = 0.2 、K T ( 1 , { 1 } ) = 0.3 。此时真实目标风险为
R T ( h 0 ) = 0.2 × 0.2 + 0.8 × 0.3 = 0.28 , 但源损失加权后仍为 0.74 。权重精确也无法纠正标签规律变化。只有未标注的目标输入时,两种机制会产生相同的目标 X 数据,因此不能仅凭这些数据检验条件不变性。
缺少覆盖时,目标风险无法识别
设源输入必为 X = 0 且标签必为零,目标输入在零和一上各占一半。考虑两个候选世界:它们在 x = 0 的标签都为零;在 x = 1 ,第一个世界的标签必为零,第二个世界的标签必为一。每个世界内部都能给源和目标指定共同标签核,因为源在 x = 1 根本没有观测约束。
两个世界产生完全相同的源有标签数据和目标无标签输入,但 h 0 的目标风险分别为零和 1 / 2 。任何只看这些数据的方法都无法分辨两者。这不是权重估计得不够准,而是 P T X ≪ P S X 失败,目标风险没有被现有信息唯一确定。
覆盖充分也可能有无限方差
在 ( 0 , 1 ) 上取源密度 p S ( x ) = 2 x 、目标密度 p T ( x ) = 1 ,令两边标签都恒为一,仍评价 h 0 。两边拥有相同的输入支持,共同标签机制也成立,但
w ( x ) = 1 2 x , R T ( h 0 ) = E S [ w ] = 1 , E S [ w 2 ] = ∫ 0 1 d x 2 x = ∞ . 加权平均依然无偏且满足大数定律,却没有有限方差。损失有界无法消除密度比的重尾,通常的有限方差标准误在这里没有依据。
推论与应用
评价一个规则与选择一个规则
若预测器 h ^ 由训练集得到,再用独立源验证集评价,条件于训练结果后,h ^ 可以视为固定规则。只要相应风险有限,就有
E [ R ^ T ( h ^ ) ∣ h ^ ] = R T ( h ^ ) . 若重用训练样本,样本与 h ^ 已有关联,上述逐项取期望的证明不再适用。总体换测度恒等式仍对每个实现出的规则成立,但训练集上的加权误差未必无偏。进一步最小化加权经验风险,还需要一致收敛或其他学习论证,才能把固定规则的评价结论推广到数据选择的规则。反复根据验证集选模型,同样会破坏把最终模型视为独立固定对象的评价协议。
共同核也解释了为何排序反转不等于 Bayes 规则改变。若允许所有可测预测器,并且存在一个可测规则,在 P S X 几乎处处的输入上选取条件最优行动,则两边要最小化的都是同一个条件损失;由 P T X ≪ P S X ,该规则也在目标几乎处处条件最优,故是两边共同的 Bayes 规则。前例中的变化来自假设类只允许两个常数:一个规则必须同时服务两个人群,改变汇总权重便改变了最优折中。
已知权重与实际修正
实际应用常需估计密度比。把估计权重代入后,误差同时来自损失采样和比值估计,精确权重下的无偏性不能直接照搬。即使权重由独立数据估计,条件于它们后得到的也是按估计权重积分的量,而不自动是 R T ( h ) 。
截断权重 w c = min { w , c } (c ≥ 0 )能压低极端样本的影响,却改变了评价目标。对非负损失,总有分解
R T ( h ) = E S [ w c L h ] + E S [ ( w − c ) + L h ] , 即使风险无穷也成立。若 R T ( h ) < ∞ ,才可相减得到总体偏差
E S [ w c L h ] − R T ( h ) = − E S [ ( w − c ) + L h ] ≤ 0. 将加权和再除以样本权重总和,则得到自归一化的重要性采样比值;随机分母通常引入有限样本偏差。二者都可以是合理的偏差与方差折中,但需要说明采用了哪一种估计量。密度比估计、一般领域适应和加权学习的一致保证,是在本页识别恒等式之上继续解决的问题。
参考资料