Skip to content

方法Method

按群验证与评价目标

Grouped validation and risk target · New-group prediction risk

先区分新实体与已见实体的预测任务,再按群切分、选择等群或等记录损失,并以独立群数解释评价精度。

形式陈述 ​

一个用户可以贡献数百条记录。若部署任务是给新用户预测,评价时应把这个用户的全部资料留在同一侧;若任务是给已注册用户预测下一次行为,允许使用其过去记录则可能正是部署条件。按群验证要把这个区别写成风险目标,再确定切分协议。

设一个群的完整资料为 W=(N,Z1,…,ZN),N≥1 是群大小。训练资料由独立群构成,学习器输出 h^。固定训练结果后,对独立新群定义

(1)Lgrp(h,W)=1N∑i=1Nℓ(h,Zi),Rgrp(h)=E[Lgrp(h,W)].

这是先抽一个新群、再在该群中均匀抽一条记录的风险。若部署流按每条记录等权,则对应

(2)Rrow(h)=E[∑i=1Nℓ(h,Zi)]E[N],0<E[N]<∞.

式(2)对大群赋予更多份额。它是群大小加权的总体分布,不等于在式(1)里“多除一次样本数”。不等群大小的目标区别也出现在群回归;本页进一步决定训练资料允许看哪些实体,以及怎样评价新实体上的整个预测流程。

独立测试群 W1,…,WG 与训练资料独立、同分布时,用

R^grp=1G∑gLgrp(h,Wg),R^row=∑g∑iℓ(h,Zgi)∑gNg.

若 E|Lgrp(h,W)|<∞,前者对固定训练结果条件无偏。后者是随机分母比值:在测试群IID、0<E[N]<∞且 E[∑i|ℓ(h,Zi)|]<∞时,由大数律分别处理分子分母得到一致性;有界损失和有限平均群大小是一组易检查的充分条件,不能同样宣称有限样本无偏。

直觉

数据文件里的行是一种存储单位,未来被服务的人、设备或家庭才可能是独立评价单位。同一个人被复制十次,不等于又来了十个新用户。群标识首先用来说明“谁与谁共享信息”,随后用来阻断训练侧通过另一行认出测试实体。

切分与计分处理两个不同问题。按群切分防止跨侧共享同一实体;等群计分决定每个实体算多少份。即使两边完全没有同名用户,若几位重度用户贡献了绝大多数记录,按行平均仍可能让他们支配总分。

例子与边界

记住实体可以让逐行测试看起来近乎完美 ​

每个实体有一个独立公平标签 Yg∼Bernoulli(1/2),并贡献两条完全相同的 (IDg,Yg)。学习器记住训练中见过的ID及其标签;遇到新ID一律预测零。标签与ID本身无可推广关系。

假设 0<r<1,每行独立地以概率 r 进入训练。条件于某行落在测试,其同胞行以概率 r 已进入训练。已有同胞时预测全对;没有同胞时仍有一半机会错,所以对一条预先指定的行,条件于它进入测试后的错误概率为

Rrow split=(1−r)⋅12.

当 r=0.8,这个条件错误概率是0.1。独立实体数增长时,按测试行汇总的损失比率也趋于此值;有限样本的测试行数随机,比率均值的期望未必恰为0.1。把整个实体按同一个开关划分后,测试ID全部未见,错误率成为0.5。这里0.5同样指独立新实体的预测错误概率。两个风险由同一学习器产生,差别来自评价任务。对“在训练中已经登记、未来标签仍不变的这些实体”,记忆器的风险确实是零;但0.1不能拿去承诺新实体风险。

只删除字面相同的行也未必足够:同一设备的相邻窗口、同一图片的不同裁剪,仍可能携带共享信息。反过来,若部署真的允许使用用户的过去数据,也不应把全部同用户记录永久排除;应按时间只给历史、评价未来,并单独报告新用户表现。

同一外层预测,两个合理目标排出相反顺序 ​

有三个完全留出的实体,记录数为 (1,1,8)。模型甲的每群平均损失为 (0,0,1),模型乙为 (1/2,1/2,1/4)。等群计分得到

R^grp(甲)=1/3,R^grp(乙)=5/12,

选择甲。等行计分却得到

R^row(甲)=8/10=0.8,R^row(乙)=3/10=0.3,

选择乙。改变权重改变了所服务的总体;这不是某个平均公式算错。应在看模型成绩之前依据部署定义选目标。

按群分折并不自动隔离全部学习 ​

若外层留出实体A,但用全部实体的标签先筛选特征、校准概率或选阈值,再只重新拟合最后一层,A仍参与了选择。完整做法是在外层训练实体中调参;每个内折仍按实体划分;校准实体与基础拟合实体分开;最后才对外层实体生成一次预测。嵌套协议给出了12实体的逐次拟合与损失表。

若家庭中不同用户还共享强信息,用户ID未必是足够粗的独立单元;如果训练与测试还处于不同时期,按家庭分组也不会消除时间漂移。群数很少或一个类别只出现在一个群时,不能靠增加折数造出可用训练数据。应预先约定失败报告或后备学习器。

推论与应用

条件无偏与群数的有限样本含义 ​

条件于独立训练资料与随机种子,h固定,测试群均值 Ug=Lgrp(h,Wg) 是IID。若原损失在 [0,1],每个 Ug 也在 [0,1],故

E[R^grp∣h]=Rgrp(h),P{|R^grp−Rgrp(h)|>ϵ∣h}≤2e−2Gϵ2.

这是对群均值应用Hoeffding界,不需要群内独立。20个实体各复制100次,δ=0.05时半径仍是 log⁡40/40≈0.304;误把2000行当独立会得到约0.0304。区间可再与 [0,1] 相交,但复制不能缩小真正的群间不确定性。

对行目标,Rrow 是两个期望之比,应另外控制分子和分母;尤其重尾群大小可能让少数实体支配结果。整群抽样讨论群内相关如何影响方差,不能把其有效样本量近似当成所有预测流程的通用界。

外层交叉验证时,各次 h(−k) 使用重叠训练群,折间误差通常相关。上述独立测试群界直接属于一个冻结模型和独立测试集;不能直接把所有外折预测视作同一个固定 h 的IID损失,也不能把折数当成独立样本量。

一份可执行的报告 ​

先列部署单位及是否允许访问已见实体历史,再列群标识形成方式、训练/校准/选择/评价各侧ID集合。对外层每个群保留样本外损失和记录数;汇总时明确等群、等行或已给业务权重。报告总行数、独立群数、最大群占比、类别在群间的分布,而不只报一个准确率。

自测与答案 ​

  1. 保持上面的记忆器,r=1/2时逐行测试与新实体测试分别是多少?答案为 1/4 与 1/2。
  2. 在三群算例中,把第三群的八行复制成八十行,等群得分改变吗?不改变;等行得分会改变,因为它评价了另一份记录组成。
参考资料
关系图谱11 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系