Skip to content

评价流程与分布变化:从实体索引到目标风险 ​

形式陈述 ​

终点不是得到一个漂亮分数,而是能重建这个分数怎样产生、它平均了谁的损失、哪些信息让它能用于未来。本页给出两段相接的任务:先评价重复实体上的模型开发流程,再分析部署人群变化。每题都有明确输入、计算结果和适用边界。

最短主线为数据角色 → 新实体风险 → 嵌套执行 → 标签先验恢复。概率是怎样拟合的不清楚时读概率校准;源输入组成变化时读协变量漂移及来源密度比。时间回放和预测集合属于按需求选择的延伸,不是所有任务都必须采用。

直觉 ​

同一份资料可以有四种不同问题:已见用户下一次表现、新用户表现、当前人群表现、换一种人群组成后的表现。切分回答允许使用谁的信息,损失定义回答错一次付多少代价,分布假设回答哪些规律可以迁移。任何一个环节改变,最后的“平均分”都可能改换含义。

例子与边界 ​

任务一:完成重复实体的全流程评价 ​

A至L共12个实体,每个各两条相同记录,输入交替为 0,1,0,1,…,标签依次为

1,1,1,1,0,1,1,1,0,1,0,1.

基础候选甲按全部基础实体计算加一平滑概率 (s+1)/(n+2),乙分别按 x=0,1分箱计算。两者都用独立校准集拟合 qa=1/2+a(p−1/2),a∈[0,1],平方损失最小;分母为零取a=0。平票选甲。

三个外折为ABCD、EFGH、IJKL。每次把余下八实体按字母分前四/后四,轮流内评价;其余四实体前二基础拟合、后二校准。内层选好候选后,全部八实体前四基础拟合、后四校准。要求:画出第一轮数据流;算三个外折预测及损失;统计真实拟合次数;说明新实体评价与最终全开发集模型的区别。

答案。 第一轮结构如下,其他两轮同样替换外层ID:

三轮内层候选平均损失依次为 (1/4,2/9)、(9/32,5/18)、(7/32,2/9),故选乙、乙、甲。三轮最终基础概率与校准系数为

  • ABCD外留出:(p0,p1)=(1/2,3/4),a=1,四项损失 (1/4,1/16,1/4,1/16)
  • EFGH外留出:(3/4,3/4),a=0,四项损失均为 1/4
  • IJKL外留出:(5/6,5/6),a=3/4,四项损失 (9/16,1/16,9/16,1/16)

外层等实体均值为 (5/32+1/4+5/16)/3=23/96。共有15次基础拟合、15次校准,48个内评价实体预测和12个外评价预测,另外36个校准实体的基础预测。所有精确内层中间量见完整执行表。

评价对象是用八个独立实体执行这一开发流程的风险。最终全12实体版本按前六/后六做两个内评价折,余下六个再前三基础拟合、后三校准;选定后A至F基础拟合、G至L校准。额外5+5次拟合,总计40次。这是另一个最终模型,不能把外层折误说成它的独立测试。

迁移检查。 若一个实体的两条记录被随机拆开,记忆器反例中对固定测试行的错误概率可从新实体的 1/2降至 (1−r)/2;这只是让训练侧认出了同一实体。若三实体大小为 (1,1,8),甲群损失 (0,0,1)、乙 (1/2,1/2,1/4),等群选甲、等行选乙。写下目标权重是评价的一部分。

任务二:从无标签目标输入恢复类别比例 ​

另取独立源验证集,真实零类100个,其中80个预测零;真实一类100个,其中10个预测零。目标100个无标签输入中31个预测零。已知输入在每个真实类别内的分布保持不变,且同一个冻结预测器用于两边。

要求:明确矩阵方向;恢复目标先验;算目标0–1风险及漏判正类成本为5时的风险;给一个可逆但不稳定的矩阵,以及一个完全不可识别的世界。

答案。 行为预测、列为真类,

C=(0.80.10.20.9),q=(0.31,0.69)T,πT=(0.3,0.7)T.

源先验 (0.5,0.5),标签权重 (0.6,1.4)。目标0–1风险为0.13,代价风险为0.41。若源后验为0.6,先验修正后为 7/9。

病态例用 C第一行为 (0.51,0.49),真目标零预测比例0.496对应正类先验0.7;仅把前者误估到0.498就把后者误估到0.6。奇异例两列相同为 (1/2,1/2)T,输出摘要不能识别先验;若连完整 X∣Y=0与 X∣Y=1都相同,则所有目标无标签输入都不能识别先验。伪逆只是返回一个数,不是额外信息。

计数表有限时这些数是插件估计,并非真实先验已被精确测得。还要报告源各类样本数、目标样本数、矩阵敏感性和迁移假设的依据。

任务三:如果固定的是标签机制,换哪种修正 ​

现在换一种已明确声明的机制:源输入比例 (0.8,0.2)、目标比例 (0.2,0.8),两层条件错误率保持 (0.1,0.9)。来源分类训练中目标占 ρ=1/3,真实来源后验为 (1/9,2/3)。

答案。 权重为 [(1−ρ)/ρ]e/(1−e)=(1/4,4),目标风险0.74。漏掉先验系数2会得到0.37。若来源后验估成 (1/10,3/5),权重成为 (2/9,3),其总体评价极限为 251/450,与0.74差 −41/225;扩大独立验证集不会消除这一偏差。

这项假设固定 P(Y∣X),任务二固定 P(X∣Y)。仅看“源目标分数变了”不能决定哪种假设成立,也不能用拟合漂亮的来源分类器证明标签机制稳定。

任务四:延迟标签与加权覆盖 ​

其一,训练样本在s预测 Ys+3,标签发布延迟两日。在起点10重新拟合,最大合法s是多少?答案为5。若目标是未来两日总量且单日值延迟一日,则第s条标签到s+3才成熟;起点6只能训练s≤3。时间箭头的含义是信息真正可用,详见滚动起点验证。

其二,源校准分数 (0.1,0.2,0.4,0.8),权重 (4,2,1,1),目标新输入权重2,要求70%覆盖。答案:总质量10,有限累计质量 (0.4,0.6,0.7,0.8),阈值0.4;点预测为2时区间 [1.6,2.4]。新输入权重升为4时,有限质量 8/12<0.7,阈值变为无穷大。不能删除未来点的原子来换取有限区间,证明在加权共形。

推论与应用 ​

一份合格的结果记录 ​

交付预测评价时,至少留下目标人群、损失、独立实体数、每层索引与随机种子、所有拟合步骤和预算、逐实体或逐起点的样本外预测。改变人群组成时,再留下迁移条件、覆盖、权重来源、校正目标和敏感性。目标风险、校准误差、预测集合覆盖属于不同指标,不能只用一个“准确率”代替。

若标签只集中出现在高风险样本中,HT估计量的选择性标注审计还提供一个独立出口:在固定8人资料池内按层随机补标,已知正纳入概率可恢复池平均损失;概率为零的层则保留真实识别缺口。这项任务已有成熟抽样接口,无需再造一套同义加权公式。

最后四个判断 ​

  • 内层最好分数与外层分数相同,就没有选择偏差吗?不能由一次同值推出;任务一正好给了同值却不同数据角色的实例
  • 所有列都相加为一的混淆矩阵就可逆吗?不,两列相同是反例
  • 做了独立权重拟合就有精确覆盖吗?没有,权重误差仍需控制
  • 没有读未来标签,就可以按所有行独立算标准误吗?不能,共享实体、重叠窗口与重叠训练资料仍产生依赖

参考资料 ​