评价流程与分布变化:从实体索引到目标风险
形式陈述
终点不是得到一个漂亮分数,而是能重建这个分数怎样产生、它平均了谁的损失、哪些信息让它能用于未来。本页给出两段相接的任务:先评价重复实体上的模型开发流程,再分析部署人群变化。每题都有明确输入、计算结果和适用边界。
最短主线为数据角色理路留出法与交叉验证Holdout · Cross-validation · 交叉验证通过隔离训练、模型选择和最终评价的数据角色估计样本外风险,并识别反复查看测试集造成的选择偏差。 → 新实体风险理路按群验证与评价目标Grouped validation and risk target · New-group prediction risk先区分新实体与已见实体的预测任务,再按群切分、选择等群或等记录损失,并以独立群数解释评价精度。 → 嵌套执行理路嵌套交叉验证的执行协议Nested cross-validation protocol · Nested model evaluation protocol对重复实体资料逐层隔离拟合、校准、调参与评价,完整复算内层选择、外层损失和实际拟合次数。 → 标签先验恢复理路标签漂移与先验恢复Label shift and prior recovery · Black box shift estimation · 标签先验漂移固定类内输入分布,用预测混淆矩阵恢复目标标签比例,计算风险与概率修正,并检查覆盖、奇异和病态边界。。概率是怎样拟合的不清楚时读概率校准理路概率校准与可靠度Probability calibration · Reliability diagram用条件正例率等于报告概率定义概率校准,计算可靠度与分箱误差,并区分校准、边际均值、分类一致性和分辨力。;源输入组成变化时读协变量漂移理路协变量漂移Covariate shift · 协变量偏移 · Covariate-shift adaptation输入人群的组成改变而给定输入的标签机制不变时,以输入密度比把源分布损失转换为目标风险。及来源密度比理路用来源分类估计密度比Density ratio estimation by classification · Domain classifier density ratio从源与目标来源概率反推输入密度比,保留采样先验因子,并把权重拟合误差传入独立风险评价。。时间回放和预测集合属于按需求选择的延伸,不是所有任务都必须采用。
直觉
同一份资料可以有四种不同问题:已见用户下一次表现、新用户表现、当前人群表现、换一种人群组成后的表现。切分回答允许使用谁的信息,损失定义回答错一次付多少代价,分布假设回答哪些规律可以迁移。任何一个环节改变,最后的“平均分”都可能改换含义。
例子与边界
任务一:完成重复实体的全流程评价
A至L共12个实体,每个各两条相同记录,输入交替为 ,标签依次为
基础候选甲按全部基础实体计算加一平滑概率 ,乙分别按 分箱计算。两者都用独立校准集拟合 ,,平方损失最小;分母为零取。平票选甲。
三个外折为ABCD、EFGH、IJKL。每次把余下八实体按字母分前四/后四,轮流内评价;其余四实体前二基础拟合、后二校准。内层选好候选后,全部八实体前四基础拟合、后四校准。要求:画出第一轮数据流;算三个外折预测及损失;统计真实拟合次数;说明新实体评价与最终全开发集模型的区别。
答案。 第一轮结构如下,其他两轮同样替换外层ID:
三轮内层候选平均损失依次为 、、,故选乙、乙、甲。三轮最终基础概率与校准系数为
- ABCD外留出:,,四项损失
- EFGH外留出:,,四项损失均为
- IJKL外留出:,,四项损失
外层等实体均值为 。共有15次基础拟合、15次校准,48个内评价实体预测和12个外评价预测,另外36个校准实体的基础预测。所有精确内层中间量见完整执行表理路嵌套交叉验证的执行协议Nested cross-validation protocol · Nested model evaluation protocol对重复实体资料逐层隔离拟合、校准、调参与评价,完整复算内层选择、外层损失和实际拟合次数。。
评价对象是用八个独立实体执行这一开发流程的风险。最终全12实体版本按前六/后六做两个内评价折,余下六个再前三基础拟合、后三校准;选定后A至F基础拟合、G至L校准。额外5+5次拟合,总计40次。这是另一个最终模型,不能把外层折误说成它的独立测试。
迁移检查。 若一个实体的两条记录被随机拆开,记忆器反例理路按群验证与评价目标Grouped validation and risk target · New-group prediction risk先区分新实体与已见实体的预测任务,再按群切分、选择等群或等记录损失,并以独立群数解释评价精度。中对固定测试行的错误概率可从新实体的 降至 ;这只是让训练侧认出了同一实体。若三实体大小为 ,甲群损失 、乙 ,等群选甲、等行选乙。写下目标权重是评价的一部分。
任务二:从无标签目标输入恢复类别比例
另取独立源验证集,真实零类100个,其中80个预测零;真实一类100个,其中10个预测零。目标100个无标签输入中31个预测零。已知输入在每个真实类别内的分布保持不变,且同一个冻结预测器用于两边。
要求:明确矩阵方向;恢复目标先验;算目标0–1风险及漏判正类成本为5时的风险;给一个可逆但不稳定的矩阵,以及一个完全不可识别的世界。
答案。 行为预测、列为真类,
源先验 ,标签权重 。目标0–1风险为0.13,代价风险为0.41。若源后验为0.6,先验修正后为 。
病态例用 第一行为 ,真目标零预测比例0.496对应正类先验0.7;仅把前者误估到0.498就把后者误估到0.6。奇异例两列相同为 ,输出摘要不能识别先验;若连完整 与 都相同,则所有目标无标签输入都不能识别先验。伪逆只是返回一个数,不是额外信息。
计数表有限时这些数是插件估计,并非真实先验已被精确测得。还要报告源各类样本数、目标样本数、矩阵敏感性和迁移假设的依据。
任务三:如果固定的是标签机制,换哪种修正
现在换一种已明确声明的机制:源输入比例 、目标比例 ,两层条件错误率保持 。来源分类训练中目标占 ,真实来源后验为 。
答案。 权重为 ,目标风险0.74。漏掉先验系数2会得到0.37。若来源后验估成 ,权重成为 ,其总体评价极限为 ,与0.74差 ;扩大独立验证集不会消除这一偏差。
这项假设固定 ,任务二固定 。仅看“源目标分数变了”不能决定哪种假设成立,也不能用拟合漂亮的来源分类器证明标签机制稳定。
任务四:延迟标签与加权覆盖
其一,训练样本在预测 ,标签发布延迟两日。在起点10重新拟合,最大合法是多少?答案为5。若目标是未来两日总量且单日值延迟一日,则第条标签到才成熟;起点6只能训练。时间箭头的含义是信息真正可用,详见滚动起点验证理路滚动起点验证与信息可用时间Rolling-origin validation · Forecast-origin evaluation · 滚动预测起点评价按每个预测起点当时真正可用的信息重建训练资料,分别核算预测步长、标签成熟时间、重叠窗口和多次重拟合成本。。
其二,源校准分数 ,权重 ,目标新输入权重2,要求70%覆盖。答案:总质量10,有限累计质量 ,阈值0.4;点预测为2时区间 。新输入权重升为4时,有限质量 ,阈值变为无穷大。不能删除未来点的原子来换取有限区间,证明在加权共形理路协变量漂移下的加权分割共形Weighted split conformal prediction · Covariate-shift weighted conformal将源校准分数与测试点的无穷大原子按密度比加权,证明目标边际覆盖,并用总变差量化独立估计权重的偏差。。
推论与应用
一份合格的结果记录
交付预测评价时,至少留下目标人群、损失、独立实体数、每层索引与随机种子、所有拟合步骤和预算、逐实体或逐起点的样本外预测。改变人群组成时,再留下迁移条件、覆盖、权重来源、校正目标和敏感性。目标风险、校准误差、预测集合覆盖属于不同指标,不能只用一个“准确率”代替。
若标签只集中出现在高风险样本中,HT估计量的选择性标注审计理路Horvitz–Thompson 估计量Horvitz-Thompson estimator以逆纳入概率恢复总体总量,逐项证明设计无偏,并区分总量与方差估计的正概率要求。还提供一个独立出口:在固定8人资料池内按层随机补标,已知正纳入概率可恢复池平均损失;概率为零的层则保留真实识别缺口。这项任务已有成熟抽样接口,无需再造一套同义加权公式。
最后四个判断
- 内层最好分数与外层分数相同,就没有选择偏差吗?不能由一次同值推出;任务一正好给了同值却不同数据角色的实例
- 所有列都相加为一的混淆矩阵就可逆吗?不,两列相同是反例
- 做了独立权重拟合就有精确覆盖吗?没有,权重误差仍需控制
- 没有读未来标签,就可以按所有行独立算标准误吗?不能,共享实体、重叠窗口与重叠训练资料仍产生依赖
参考资料
- Cawley and Talbot, On Over-fitting in Model Selection and Subsequent Selection Bias in Performance Evaluation, 2010,§4–§5
- Lipton, Wang and Smola, Detecting and Correcting for Label Shift with Black Box Predictors, 2018,§3–§4
- Hyndman and Athanasopoulos, Time Series Cross-validation,§5.10
- Tibshirani, Barber, Candès and Ramdas, Conformal Prediction Under Covariate Shift, 2019,§2–§3