Skip to content

方法Method

嵌套交叉验证的执行协议

Nested cross-validation protocol · Nested model evaluation protocol

对重复实体资料逐层隔离拟合、校准、调参与评价,完整复算内层选择、外层损失和实际拟合次数。

形式陈述 ​

嵌套交叉验证评价的是一套开发流程。流程不仅包括最终模型,还包括特征处理、超参数搜索、概率校准和失败时的后备规则。给定资料后,必须能回答每次拟合读了哪些标签,每个分数又影响了哪次选择。

设有 G 个实体,实体内可以有多条相关记录,按新实体风险评价。要求 K≥2、候选集合非空,并且每次所需基础拟合、校准、内评价和外评价集合都能非空构造;若实体或类别太少,返回预先声明的失败或后备结果,不借用评价资料补足。预先固定非空外折 O1,…,OK,实体不交叠且覆盖全部资料。外层第 k 轮令 Tk={1,…,G}∖Ok,只在 Tk 内执行:

  1. 把 Tk 分成内层评价折 Vkj;候选集合 Λ、损失与平票规则预先确定
  2. 对每个 λ,j,将 Tk∖Vkj 再划成基础拟合集 Bkj 和校准集 Ckj。所有需要学习的预处理仅在 Bkj 拟合;基础模型也只读 Bkj
  3. 冻结基础模型,用 Ckj 的样本外基础分数和标签拟合校准映射。在 Vkj 评价完整“预处理—基础模型—校准”组合
  4. 按内层评价实体数汇总损失,选择 λ^k。再把整个 Tk 按既定规则划为 Bk,Ck,重新拟合一套组合
  5. 冻结该组合,在 Ok 生成预测并记录损失,外层结果不再返回本轮的任何选择步骤

每个具体拟合中 B,C,V,O 互不相交;实体的所有行一同移动。校准方法也是候选时,应连同基础模型一起列入 Λ。本页采用专用校准子集;交叉校准是另一种可行实现,但它有自己的模型数、评分分布和成本,不能在计算次数时把两者混为一谈。

设外层第 k 轮组合为 hk,实体平均损失为 Lg(hk),则等实体汇总为

(1)R^outer=1G∑k=1K∑g∈OkLg(hk).

外折大小不同时,不能不加权平均折均值。这个量也不是某个单一模型在全部 G 实体上训练后的条件风险。

直觉

内层分数负责回答“这次该选哪个候选”,外层分数回答“把整套选择步骤交给一份新开发资料,会得到怎样的预测”。校准也从标签中学参数,所以必须在箭头中占一个真正的位置。

一次外层评价的真实数据流

图中的某个实体可以在另一内折改当训练角色,但在同一次拟合中不能跨侧。外层A至D在两次内层评价和最终校准中都没有入口。

例子与边界

24行资料,只有12个实体 ​

每个字母实体各有两条完全相同的记录,例如A1、A2都为 (x,y)=(0,1)。两条记录是同一实体的重复测量,本例先对实体内重复记录作固定聚合;基础拟合、校准和损失都让每个实体算一份。这项聚合规则预先给定,不含额外学习参数。

实体 A B C D E F G H I J K L
x 0 1 0 1 0 1 0 1 0 1 0 1
y 1 1 1 1 0 1 1 1 0 1 0 1

两个候选基础模型都用加一平滑:候选甲是常数概率 p=(s+1)/(n+2);候选乙按 x=0,1 分箱,各取 px=(sx+1)/(nx+2)。n和s是基础拟合实体数与正标签数,空箱自动报 1/2。二值输入的含义事先给定,没有需估计的标准化或特征筛选。

两者都接同一种一参数校准:

qa(x)=12+a{p(x)−12},0≤a≤1.

在独立校准实体上最小化平方损失。令 dg=p(xg)−1/2,展开二次式得

(2)a^=clip[0,1]∑g∈Cdg(yg−1/2)∑g∈Cdg2.

分母为零时约定 a=0。输出是 [0,1] 内的概率;这只是有限样本的一种收缩拟合,不宣称有限校准集已经证明总体校准。

损失为 (q−y)2。外折依次为ABCD、EFGH、IJKL。每个外层的八个训练实体按字母排序,前四与后四轮流当内层评价折;余下四个中前二基础拟合、后二校准。平票选甲。最终外层组合用八个训练实体的前四基础拟合、后四校准。

六次内层划分与十二次完整候选拟合 ​

下表每行执行甲、乙各一次。B为基础拟合,C为校准,V为内评价,最后两列是校准后的平均损失。

外层留出 B C V 甲 乙
ABCD IJ KL EFGH 1/4 7/36
ABCD EF GH IJKL 1/4 1/4
EFGH IJ KL ABCD 1/4 5/18
EFGH AB CD IJKL 5/16 5/18
IJKL EF GH ABCD 1/4 1/4
IJKL AB CD EFGH 3/16 7/36

以第一行的乙为例:IJ分别为 (0,0),(1,1),基础概率为 (1/3,2/3);KL也是这两个标签,式(2)无约束值为3,截为 a=1。EFGH的四项损失是 (1/9,1/9,4/9,1/9),均值 7/36。第二行基础概率仍为 (1/3,2/3),但GH标签都为一,两个 dg 符号相反,分子为零,校准变为常报 1/2。

全部内层拟合的基础概率与校准参数如下,足以从原数据逐项恢复上表:

B,C 甲的 (p0,p1);a 乙的 (p0,p1);a
IJ,KL (1/2,1/2);0 (1/3,2/3);1
EF,GH (1/2,1/2);0 (1/3,2/3);0
AB,CD (3/4,3/4);1 (2/3,2/3);1

虽然相同 B,C 在不同外层出现,本次基准实现仍逐次拟合,不缓存。三个外层内评价平均分别为:ABCD外留出时,甲 1/4、乙 2/9,选乙;EFGH外留出时,甲 9/32、乙 5/18,选乙;IJKL外留出时,甲 7/32、乙 2/9,选甲。特别是 9/32−5/18=1/288,微小差异也必须按预定规则处理,不能看过外层成绩后改选。

三次外层重拟合与实际损失 ​

外层 O 最终 B,C 候选 基础 (p0,p1) a 外层四项损失 均值
ABCD EFGH,IJKL 乙 (1/2,3/4) 1 1/4,1/16,1/4,1/16 5/32
EFGH ABCD,IJKL 乙 (3/4,3/4) 0 1/4,1/4,1/4,1/4 1/4
IJKL ABCD,EFGH 甲 (5/6,5/6) 3/4 9/16,1/16,9/16,1/16 5/16

最后一行基础数据四个全为正,故甲报 5/6;校准集EFGH正例率为 3/4,式(2)给 a=3/4,最终常报 3/4。三折等大,式(1)得到

R^outer=5/32+1/4+5/163=2396≈0.23958.

24行直接平均给同一数,仅因为每个实体恰好重复两次。它没有把独立实体数从12变成24。

推论与应用

拟合次数与最终上线模型 ​

若外折 K、内折 J、候选数 M,本协议每个候选每内折各拟合一次基础模型、一次校准器;外层选定后再各拟合一次。因此两类拟合各为

K(JM+1).

本例 K=3,J=2,M=2,基础拟合15次、校准15次,共30次。内评价有 3⋅2⋅2⋅4=48 个实体概率输出,外评价12个;校准参数学习还需要 12⋅2+3⋅4=36 个基础概率输出。固定聚合与计分另有线性成本。

若每个基础模型前再加一个需学习的标准化器,按本基准无缓存实现还应有15次标准化拟合。缓存仅在输入索引、候选变换、随机种子等完全相同且不改变协议时才可复用,并应报告实际次数。本例没有调用需要学习的预处理器,因此不能把15次假想拟合计入真实成本。

完成评价后,可在全部12实体上重新执行同一选择流程,再保留独立的校准部分。具体地,先将A至L按字母分成前六/后六两个内评价折;每次余下六个再按字母分成前三基础拟合、后三校准。选定候选后,以A至F基础拟合、G至L校准。这样仍用两内折、两个候选,最后额外付5次基础拟合与5次校准,总共40次;所得最终模型没有再经这12实体的独立最终测试。可以把它交付,但须把“流程的外层评价”与“最终全开发集模型”区别说明。

评价的是何种风险 ​

若实体资料IID、外划分独立于数据、每轮学习过程只读其训练侧,条件于 Tk 的全部学习结果,Ok 是独立新实体。所以每个外层均值的条件期望是 hk 的新实体风险;再平均训练随机性,得到使用八实体开发流程的期望风险。不同外层训练集重叠,不妨碍这个逐折期望等式,却会影响联合方差。

若字母只是固定列表位置,以上是一份可复算的执行实例;要把它解释成统计保证,仍需实体来自所声明的抽样机制。若它们是时间排序的病例,则应改用滚动起点验证,不能仅靠“没有同ID”就套IID结论。

选择偏差可以只有两次硬币那么简单 ​

设两个候选真实错误率都为 1/2,各在一个独立验证点上得到独立的伯努利错误指示。挑较小者后报告它的验证损失;最小值仅在两者都错时为一,所以平均报告为 1/4。选中的规则在独立新点上仍有错误率 1/2。扩大验证资料通常有帮助,但“取最小”的运算本身不能提供独立评价。

外层成绩若又被用于在很多候选流程之间选冠军,则外层也成了新一层选择资料。此时应如实报告探索性比较,或再取得未参与选择的测试资料;不能不断换名称保留同一独立性证明。

自测与答案 ​

  1. 把第一外折ABCD用于重新拟合校准器,再评价ABCD,破坏了哪层?答案:外层评价;它直接参与了概率后处理。
  2. 仅保存每折最低内层损失并平均,能否当作外层评价?不能,尽管这次数字恰好相等。最低内层分数平均为 (2/9+5/18+7/32)/3=23/96,本例恰巧同值,但两者使用的资料角色、预测器和评价对象不同。这种数值巧合更说明不能用最后一个数字替代索引审计。
参考资料
关系图谱10 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系