Skip to content

模型Model

协变量漂移

Covariate shift · 协变量偏移 · Covariate-shift adaptation

输入人群的组成改变而给定输入的标签机制不变时,以输入密度比把源分布损失转换为目标风险。

形式陈述 ​

协变量漂移区分两个分布:有标签数据来自源分布 PS,部署表现按目标分布 PT 评价。它假设输入 X 的出现频率可以改变,但给定同一个输入后,标签 Y 的生成机制保持不变。例如,新旧月份邮件中不同发件域的比例可以变化,而每一种已记录的邮件特征所对应的垃圾邮件概率保持不变。这项条件不变性是模型假设,不能仅由“训练集和部署集不同”推出。

共同标签机制与覆盖条件 ​

严格地,取标准 Borel 输入空间 X 与标签空间 Y,以保证可以使用正则条件分布。设存在同一个概率核 K,使

Pj(dx,dy)=PjX(dx)K(x,dy),j∈{S,T}.

这里 K(x,B) 是给定 X=x 后标签落入 B 的概率。共用 K 表示整个条件标签分布不变;在回归中,只要求条件均值相同一般不够,因为损失还可能依赖条件方差或更高阶信息。条件分布本来只在对应边缘分布的几乎处处意义下确定;共同核要求存在相容的版本,而不是要求零概率输入处任意选出的版本也逐点一致。

为了从源数据识别目标风险,再要求目标输入分布相对于源输入分布绝对连续:

PTX≪PSX,w(x)=dPTXdPSX(x).

方向不能颠倒:源分布赋予零概率的输入集合,目标分布也必须赋予零概率。源数据可以包含部署时不再出现的人群,此时相应权重是零。条件并不要求两边的支持完全相同,更不保证 w 有界;有密度时,它就是目标密度与源密度之比。

目标风险的加权恒等式 ​

固定一个可测预测器 h,令 Lh(x,y)=ℓ(h(x),y)≥0,并用共同标签核定义条件平均损失

mh(x)=∫Lh(x,y)K(x,dy).

则目标总体风险满足

RT(h)=EPT[Lh(X,Y)]=EPS[w(X)Lh(X,Y)].

证明只需把两层平均分开。先对同一输入处的标签取平均,再改变输入的积分测度:

RT(h)=∫mh(x)PTX(dx)=∫w(x)mh(x)PSX(dx)=∫∫w(x)Lh(x,y)K(x,dy)PSX(dx)=EPS[w(X)Lh(X,Y)].

第二步使用输入分布的 Radon–Nikodym 导数,第三步使用共同核与非负积分的迭代规则。因此联合分布的换测度权重也只依赖 x,即 dPT/dPS(x,y)=w(x)。对非负损失,恒等式允许两边同为无穷;若要估计一个有限风险,则须另加可积性。允许带符号损失时,可用绝对可积性保证同一推导成立。

独立源验证集上的估计 ​

设 (Xi,Yi)i=1n 是与 h 独立的源分布IID 样本,并且使用精确权重 w。若 ES[wLh]<∞,定义

R^T(h)=1n∑i=1nw(Xi)Lh(Xi,Yi).

每一项的期望由上式等于 RT(h),所以线性性给出 E[R^T(h)]=RT(h);大数定律又给出 R^T(h)→RT(h) 几乎必然。这是重要性采样在学习风险评价中的具体应用。若二阶矩有限,样本独立还给出

Var(R^T(h))=ES[w(X)2Lh(X,Y)2]−RT(h)2n.

无偏、一致和有限方差是三件事;前两项并不自动带来第三项。

直觉

把输入空间想成不同人群。源数据告诉我们每个人群内部的错误率,但源总体错误率使用的是旧人群比例。部署人群比例改变时,内部错误率即使完全不变,汇总结果也会改变。密度比 w 正好把旧比例乘成新比例:目标中更常见的人群获得更大权重,目标中减少的人群获得更小权重。

权重并没有创造新标签。它的有效性依赖两座桥:源数据必须覆盖目标需要的人群,而这些人群内部的标签机制必须可从源迁移到目标。第一座桥由绝对连续性保证,第二座桥由共同条件核保证。两者成立时,剩下的是平均方式的改变;其中任何一项失败,仅调整输入权重都不能保证恢复目标风险。

输入比例变化与风险排序反转
例子与边界

两个人群让模型排序反转 ​

令 X,Y∈{0,1},采用 0–1 损失。分布与权重如下;每一行的条件标签概率在源和目标中相同。

输入层 源比例 PS(X=x) 目标比例 PT(X=x) K(x,{1}) 权重 w(x)
x=0 4/5 1/5 1/10 1/4
x=1 1/5 4/5 9/10 4

先看总是预测零的 h0。它恰在 Y=1 时出错,因此

RS(h0)=45110+15910=1350=0.26,RT(h0)=15110+45910=3750=0.74.

总是预测一的 h1 在每个样本上的错误指示量与 h0 互补,所以 RS(h1)=0.74,RT(h1)=0.26。源分布偏爱 h0,目标分布偏爱 h1。标签机制没有变化,但在只允许这两个常数规则的假设类里,最优预测器变了。

使用源分布和权重,确实恢复目标风险:

ES[wLh0]=4514110+15⋅4⋅910=0.02+0.72=0.74.

这里稀少的 x=1 源样本承载了大部分目标风险。代价可以精确算出。因为 0–1 损失满足 Lh02=Lh0,

ES[(wLh0)2]=45(14)2110+15⋅42⋅910=577200=2.885,Var(R^T(h0))=2.885−0.742n=2.3374n.

若能直接取得同样大小的目标 IID 验证集,平均错误率的方差则是 0.74×0.26/n=0.1924/n。这个例子的源加权评价约有其 12.15 倍方差。无偏说的是重复采样的平均值正确,不是说一份有限验证集会准确,也不是说加权必然比目标采样更省数据。

条件机制改变时,精确权重也会失效 ​

保留上表的源分布和两边输入比例,只把目标正标签概率改为 KT(0,{1})=0.2、KT(1,{1})=0.3。此时真实目标风险为

RT(h0)=0.2×0.2+0.8×0.3=0.28,

但源损失加权后仍为 0.74。权重精确也无法纠正标签规律变化。只有未标注的目标输入时,两种机制会产生相同的目标 X 数据,因此不能仅凭这些数据检验条件不变性。

缺少覆盖时,目标风险无法识别 ​

设源输入必为 X=0 且标签必为零,目标输入在零和一上各占一半。考虑两个候选世界:它们在 x=0 的标签都为零;在 x=1,第一个世界的标签必为零,第二个世界的标签必为一。每个世界内部都能给源和目标指定共同标签核,因为源在 x=1 根本没有观测约束。

两个世界产生完全相同的源有标签数据和目标无标签输入,但 h0 的目标风险分别为零和 1/2。任何只看这些数据的方法都无法分辨两者。这不是权重估计得不够准,而是 PTX≪PSX 失败,目标风险没有被现有信息唯一确定。

覆盖充分也可能有无限方差 ​

在 (0,1) 上取源密度 pS(x)=2x、目标密度 pT(x)=1,令两边标签都恒为一,仍评价 h0。两边拥有相同的输入支持,共同标签机制也成立,但

w(x)=12x,RT(h0)=ES[w]=1,ES[w2]=∫01dx2x=∞.

加权平均依然无偏且满足大数定律,却没有有限方差。损失有界无法消除密度比的重尾,通常的有限方差标准误在这里没有依据。

推论与应用

评价一个规则与选择一个规则 ​

若预测器 h^ 由训练集得到,再用独立源验证集评价,条件于训练结果后,h^ 可以视为固定规则。只要相应风险有限,就有

E[R^T(h^)∣h^]=RT(h^).

若重用训练样本,样本与 h^ 已有关联,上述逐项取期望的证明不再适用。总体换测度恒等式仍对每个实现出的规则成立,但训练集上的加权误差未必无偏。进一步最小化加权经验风险,还需要一致收敛或其他学习论证,才能把固定规则的评价结论推广到数据选择的规则。反复根据验证集选模型,同样会破坏把最终模型视为独立固定对象的评价协议。

共同核也解释了为何排序反转不等于 Bayes 规则改变。若允许所有可测预测器,并且存在一个可测规则,在 PSX 几乎处处的输入上选取条件最优行动,则两边要最小化的都是同一个条件损失;由 PTX≪PSX,该规则也在目标几乎处处条件最优,故是两边共同的 Bayes 规则。前例中的变化来自假设类只允许两个常数:一个规则必须同时服务两个人群,改变汇总权重便改变了最优折中。

已知权重与实际修正 ​

实际应用常需估计密度比。把估计权重代入后,误差同时来自损失采样和比值估计,精确权重下的无偏性不能直接照搬。即使权重由独立数据估计,条件于它们后得到的也是按估计权重积分的量,而不自动是 RT(h)。

截断权重 wc=min{w,c}(c≥0)能压低极端样本的影响,却改变了评价目标。对非负损失,总有分解

RT(h)=ES[wcLh]+ES[(w−c)+Lh],

即使风险无穷也成立。若 RT(h)<∞,才可相减得到总体偏差

ES[wcLh]−RT(h)=−ES[(w−c)+Lh]≤0.

将加权和再除以样本权重总和,则得到自归一化的重要性采样比值;随机分母通常引入有限样本偏差。二者都可以是合理的偏差与方差折中,但需要说明采用了哪一种估计量。密度比估计、一般领域适应和加权学习的一致保证,是在本页识别恒等式之上继续解决的问题。

参考资料
关系图谱19 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系