Skip to content

方法Method

用来源分类估计密度比

Density ratio estimation by classification · Domain classifier density ratio

从源与目标来源概率反推输入密度比,保留采样先验因子,并把权重拟合误差传入独立风险评价。

形式陈述 ​

协变量漂移的评价公式需要 w(x)=pT(x)/pS(x),实际通常只有两批输入样本。可以给它们添加“来自哪里”的标签,转成概率分类问题,而不分别估计两个高维密度。

构造辅助来源变量 D∈{0,1}:D=0表示源,D=1表示目标。选定混合先验 P(D=1)=ρ∈(0,1),条件输入分布分别为 PSX,PTX。记

e(x)=P(D=1∣X=x).

由Bayes公式,在源密度为正处,

(1)e(x)=ρpT(x)(1−ρ)pS(x)+ρpT(x),w(x)=1−ρρe(x)1−e(x).

若 PTX≪PSX,可改用相对于 PSX 的密度写同一证明。源几乎处处的真实 e<1;目标有质量而源为零的区域没有有限密度比,来源分类也不能修复这一覆盖缺口。

算法先冻结取样比例、来源标签方向和训练损失,再拟合概率模型 e^,最后按式(1)转为 w^。直接混合 nS个源点与nT个目标点、给予所有点同等来源分类权重时,对应 ρ=nT/(nS+nT)。若做类别重采样或加权训练,应使用分类器实际拟合的混合先验;原文件中的行数比例未必仍是正确的 ρ。

输出需保存来源模型、实际先验、概率裁剪规则以及估计权重。辅助标签D不等于原任务标签Y;来源容易分类,只说明输入分布不同,并未检验共同 P(Y∣X)。

直觉

某种输入在目标样本里很常见、源样本里罕见,它更容易被来源分类器认作目标。将这个后验概率转成赔率,再除去我们自己设定的来源先验赔率,就恢复两个人群的相对出现频率。

分类器需要输出有概率意义的数,而不仅是“源或目标”。将0.51改成0.99,来源类别都仍判为目标,但赔率从约1变成99;同样的分类正确率可以对应完全不同的风险权重。

例子与边界

不平衡来源样本的精确换算 ​

沿用两个人群:源的 PS(X=0)=4/5、PS(X=1)=1/5;目标反过来为 1/5,4/5。取两倍于目标数量的源样本,故 ρ=1/3。准确的来源后验为

e(0)=1/9,e(1)=2/3.

式(1)的先验系数是2,因此

w(0)=21/98/9=1/4,w(1)=22/31/3=4.

两层条件错误率分别为 1/10,9/10 时,目标风险为

4514110+15⋅4⋅910=3750=0.74.

若漏掉先验系数2,权重整体少一半,普通加权均值会趋于0.37。把样本权重再归一化可能消掉这次共同倍数错误,但已经换成比率估计;它不能保证修复随输入变化的权重误差。

若估得 e^(0)=1/10,e^(1)=3/5,则 w^=(2/9,3),加权风险的总体极限变为

4529110+15⋅3⋅910=251450≈0.55778,

偏差为 −41/225≈−0.18222。即使独立评价样本无限多,也只会更准确地估计这个错误权重下的量。

来源概率总体校准也可能不够 ​

永远报 e^=ρ=1/3 的来源模型,确实满足总体概率校准:所有点被放进同一个分数档,该档的目标比例就是1/3。但它给出的权重恒为1,完全丢掉本例的输入组成变化。

因此需要的是足够准确的 e(x),或能控制所关心风险的密度比误差;粗分数的总体校准不能替代输入层面的后验拟合。来源模型的可靠度、分辨力和分布覆盖要分别检查。

接近一时的非线性放大 ​

对固定 ρ,令 c=(1−ρ)/ρ。直接通分可得

(2)|w^−w|=c|e^−e|(1−e^)(1−e).

若真实和估计来源概率都不超过 1−ε,则 |w^−w|≤cε−2|e^−e|。这是有分母下界时的稳定性,不是全空间自动成立的常数。

例如 ρ=1/2,e=0.99给 w=99,e^=0.98给 w^=49;概率只差0.01,权重却差50。把概率裁剪到0.95会将权重压到19,降低波动但引入额外截断误差。不能用裁剪后的有界性宣称真实权重本来有界。

推论与应用

独立风险评价的误差账本 ​

设原任务模型 h及来源模型 e^由其他资料拟合并冻结;另有 n≥1个与上述拟合资料独立、来自源分布的IID验证样本 Z1,…,Zn。假设 0≤Lh≤1,以及实际返回的 0≤w^≤W<∞。定义 Pnf=n−1∑if(Zi)。条件于全部拟合结果,恒等分解为

(3)Pn(w^Lh)−RT(h)=(Pn−PS)(w^Lh)+PS[(w^−w)Lh].

第一项是验证抽样误差。对取值区间 [0,W] 使用Hoeffding不等式;第二项用 Lh≤1。对 0<δ<1,以至少 1−δ的条件概率,

(4)|Pn(w^Lh)−RT(h)|≤Wlog⁡(2/δ)2n+ES|w^−w|.

若有独立理论或证据保证最后一项至多 ϵw,才能把它换成可报告的数值界;单看当前权重的直方图并不能知道该项。若该误差保证本身仅以概率 1−δw成立,则用并集界将总失败概率记为 δ+δw。

本例错误权重的 L1(PS)误差为

45|29−14|+15|3−4|=29,

确实大于实际风险偏差 41/225。取 W=3,n=10000,δ=0.05,抽样半径约0.04074;仅有这份粗权重证据时,总上界仍约0.26297。增大验证集只会缩小第一项。

数据复用与下一步选择 ​

独立拟合权重不会自动消除其偏差,但允许式(3)中清楚地区分两类误差。若权重分类器见过这些验证输入,即使没有见到任务标签,w^(Xi)也依赖评价样本,不能原样使用条件IID的证明。可重新划分资料,或构造逐折交叉拟合并分别分析每个折;交叉拟合不会凭空证明权重准确。

用估计权重调参时,权重学习也属于被评价的整体流程。若只想修正预测集合的覆盖,加权分割共形还需要测试点自身的权重和相应秩构造;风险加权平均并不等于覆盖修正。

来源分类的训练成本取决于实际模型,不能只报一个统一线性复杂度。训练后,对每个验证点进行一次来源概率预测、一次赔率换算和一次任务损失计算;若有 n个验证点,纯汇总是 O(n),内存可逐点累计。

自测与答案 ​

  1. 训练来源分类器时将两类重采样到等大,该用哪个先验?用实际平衡目标的 ρ=1/2,并确认输出概率确实对应它;不能继续按原文件数量换算。
  2. 保持 e^不变,把独立验证样本增大100倍,式(4)哪项缩小?抽样项缩小10倍,权重偏差项不变。
参考资料
  • Steffen Bickel, Michael Brückner and Tobias Scheffer, Discriminative Learning Under Covariate Shift, JMLR 10, 2009,§3.2–§3.3 的式(12)、(17)及§7的两阶段程序。该文来源标签方向与本页相反,本文按 D=1 为目标重新推导先验赔率公式。
  • Ryan J. Tibshirani, Rina Foygel Barber, Emmanuel J. Candès and Aaditya Ramdas, Conformal Prediction Under Covariate Shift, NeurIPS 2019,§2.2、式(9),用来源分类估计权重及其概率裁剪。式(2)–(4)和二点数值为本文独立推导,不把经验实验当作精确权重定理。
关系图谱12 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系