“用估计权重调参时,权重学习也属于被评价的整体流程。若只想修正预测集合的覆盖,加权分割共形还需要测试点自身的权重和相应秩构造;风险加权平均并不等于覆盖修正。”
形式陈述
嵌套交叉验证评价的是一套开发流程。流程不仅包括最终模型,还包括特征处理、超参数搜索、概率校准和失败时的后备规则。给定资料后,必须能回答每次拟合读了哪些标签,每个分数又影响了哪次选择。
设有
- 把
分成内层评价折 ;候选集合 、损失与平票规则预先确定 - 对每个
,将 再划成基础拟合集 和校准集 。所有需要学习的预处理仅在 拟合;基础模型也只读 - 冻结基础模型,用
的样本外基础分数和标签拟合校准映射。在 评价完整“预处理—基础模型—校准”组合 - 按内层评价实体数汇总损失,选择
。再把整个 按既定规则划为 ,重新拟合一套组合 - 冻结该组合,在
生成预测并记录损失,外层结果不再返回本轮的任何选择步骤
每个具体拟合中
设外层第
外折大小不同时,不能不加权平均折均值。这个量也不是某个单一模型在全部
直觉
内层分数负责回答“这次该选哪个候选”,外层分数回答“把整套选择步骤交给一份新开发资料,会得到怎样的预测”。校准也从标签中学参数,所以必须在箭头中占一个真正的位置。
图中的某个实体可以在另一内折改当训练角色,但在同一次拟合中不能跨侧。外层A至D在两次内层评价和最终校准中都没有入口。
例子与边界
24行资料,只有12个实体
每个字母实体各有两条完全相同的记录,例如A1、A2都为
| 实体 | A | B | C | D | E | F | G | H | I | J | K | L |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | |
| 1 | 1 | 1 | 1 | 0 | 1 | 1 | 1 | 0 | 1 | 0 | 1 |
两个候选基础模型都用加一平滑:候选甲是常数概率
两者都接同一种一参数校准:
在独立校准实体上最小化平方损失。令
分母为零时约定
损失为
六次内层划分与十二次完整候选拟合
下表每行执行甲、乙各一次。
| 外层留出 | 甲 | 乙 | |||
|---|---|---|---|---|---|
| ABCD | IJ | KL | EFGH | ||
| ABCD | EF | GH | IJKL | ||
| EFGH | IJ | KL | ABCD | ||
| EFGH | AB | CD | IJKL | ||
| IJKL | EF | GH | ABCD | ||
| IJKL | AB | CD | EFGH |
以第一行的乙为例:IJ分别为
全部内层拟合的基础概率与校准参数如下,足以从原数据逐项恢复上表:
| 甲的 |
乙的 |
|
|---|---|---|
| IJ,KL | ||
| EF,GH | ||
| AB,CD |
虽然相同
三次外层重拟合与实际损失
| 外层 |
最终 |
候选 | 基础 |
外层四项损失 | 均值 | |
|---|---|---|---|---|---|---|
| ABCD | EFGH,IJKL | 乙 | ||||
| EFGH | ABCD,IJKL | 乙 | ||||
| IJKL | ABCD,EFGH | 甲 |
最后一行基础数据四个全为正,故甲报
24行直接平均给同一数,仅因为每个实体恰好重复两次。它没有把独立实体数从12变成24。
推论与应用
拟合次数与最终上线模型
若外折
本例
若每个基础模型前再加一个需学习的标准化器,按本基准无缓存实现还应有15次标准化拟合。缓存仅在输入索引、候选变换、随机种子等完全相同且不改变协议时才可复用,并应报告实际次数。本例没有调用需要学习的预处理器,因此不能把15次假想拟合计入真实成本。
完成评价后,可在全部12实体上重新执行同一选择流程,再保留独立的校准部分。具体地,先将A至L按字母分成前六/后六两个内评价折;每次余下六个再按字母分成前三基础拟合、后三校准。选定候选后,以A至F基础拟合、G至L校准。这样仍用两内折、两个候选,最后额外付5次基础拟合与5次校准,总共40次;所得最终模型没有再经这12实体的独立最终测试。可以把它交付,但须把“流程的外层评价”与“最终全开发集模型”区别说明。
评价的是何种风险
若实体资料IID、外划分独立于数据、每轮学习过程只读其训练侧,条件于
若字母只是固定列表位置,以上是一份可复算的执行实例;要把它解释成统计保证,仍需实体来自所声明的抽样机制。若它们是时间排序的病例,则应改用滚动起点验证,不能仅靠“没有同ID”就套IID结论。
选择偏差可以只有两次硬币那么简单
设两个候选真实错误率都为
外层成绩若又被用于在很多候选流程之间选冠军,则外层也成了新一层选择资料。此时应如实报告探索性比较,或再取得未参与选择的测试资料;不能不断换名称保留同一独立性证明。
自测与答案
- 把第一外折ABCD用于重新拟合校准器,再评价ABCD,破坏了哪层?答案:外层评价;它直接参与了概率后处理。
- 仅保存每折最低内层损失并平均,能否当作外层评价?不能,尽管这次数字恰好相等。最低内层分数平均为
,本例恰巧同值,但两者使用的资料角色、预测器和评价对象不同。这种数值巧合更说明不能用最后一个数字替代索引审计。
参考资料
- Gavin C. Cawley and Nicola L. C. Talbot, On Over-fitting in Model Selection and Subsequent Selection Bias in Performance Evaluation, JMLR 11, 2010,§4–§5(尤其§5.3),选择准则的波动及评价偏差。本文12实体、收缩校准器与精确损失表为独立设计的教学实验。
- scikit-learn developers, Cross-validation: evaluating estimator performance,“Data transformation with held-out data”、§3.1.2.4;Nested versus non-nested cross-validation,外层评估整体搜索流程的官方例子。