“设有 $G$ 个实体,实体内可以有多条相关记录,按新实体风险评价。要求 $K\ge2$、候选集合非空,并且每次所需基础拟合、校准、内评价和外评价集合都能非空构造;若实体或类别太少,返回预先声…”
形式陈述
一个用户可以贡献数百条记录。若部署任务是给新用户预测,评价时应把这个用户的全部资料留在同一侧;若任务是给已注册用户预测下一次行为,允许使用其过去记录则可能正是部署条件。按群验证要把这个区别写成风险目标,再确定切分协议。
设一个群的完整资料为
这是先抽一个新群、再在该群中均匀抽一条记录的风险。若部署流按每条记录等权,则对应
式(2)对大群赋予更多份额。它是群大小加权的总体分布,不等于在式(1)里“多除一次样本数”。不等群大小的目标区别也出现在群回归;本页进一步决定训练资料允许看哪些实体,以及怎样评价新实体上的整个预测流程。
独立测试群
若
直觉
数据文件里的行是一种存储单位,未来被服务的人、设备或家庭才可能是独立评价单位。同一个人被复制十次,不等于又来了十个新用户。群标识首先用来说明“谁与谁共享信息”,随后用来阻断训练侧通过另一行认出测试实体。
切分与计分处理两个不同问题。按群切分防止跨侧共享同一实体;等群计分决定每个实体算多少份。即使两边完全没有同名用户,若几位重度用户贡献了绝大多数记录,按行平均仍可能让他们支配总分。
例子与边界
记住实体可以让逐行测试看起来近乎完美
每个实体有一个独立公平标签
假设
当
只删除字面相同的行也未必足够:同一设备的相邻窗口、同一图片的不同裁剪,仍可能携带共享信息。反过来,若部署真的允许使用用户的过去数据,也不应把全部同用户记录永久排除;应按时间只给历史、评价未来,并单独报告新用户表现。
同一外层预测,两个合理目标排出相反顺序
有三个完全留出的实体,记录数为
选择甲。等行计分却得到
选择乙。改变权重改变了所服务的总体;这不是某个平均公式算错。应在看模型成绩之前依据部署定义选目标。
按群分折并不自动隔离全部学习
若外层留出实体A,但用全部实体的标签先筛选特征、校准概率或选阈值,再只重新拟合最后一层,A仍参与了选择。完整做法是在外层训练实体中调参;每个内折仍按实体划分;校准实体与基础拟合实体分开;最后才对外层实体生成一次预测。嵌套协议给出了12实体的逐次拟合与损失表。
若家庭中不同用户还共享强信息,用户ID未必是足够粗的独立单元;如果训练与测试还处于不同时期,按家庭分组也不会消除时间漂移。群数很少或一个类别只出现在一个群时,不能靠增加折数造出可用训练数据。应预先约定失败报告或后备学习器。
推论与应用
条件无偏与群数的有限样本含义
条件于独立训练资料与随机种子,
这是对群均值应用Hoeffding界,不需要群内独立。20个实体各复制100次,
对行目标,
外层交叉验证时,各次
一份可执行的报告
先列部署单位及是否允许访问已见实体历史,再列群标识形成方式、训练/校准/选择/评价各侧ID集合。对外层每个群保留样本外损失和记录数;汇总时明确等群、等行或已给业务权重。报告总行数、独立群数、最大群占比、类别在群间的分布,而不只报一个准确率。
自测与答案
- 保持上面的记忆器,
时逐行测试与新实体测试分别是多少?答案为 与 。 - 在三群算例中,把第三群的八行复制成八十行,等群得分改变吗?不改变;等行得分会改变,因为它评价了另一份记录组成。
参考资料
- scikit-learn developers, Cross-validation: evaluating estimator performance,§3.1.2.4 的 grouped data、GroupKFold 和 LeaveOneGroupOut,以及“Data transformation with held-out data”。本文目标公式、记忆器反例和群数界为自包含推导。
- A. Colin Cameron and Douglas L. Miller, A Practitioner’s Guide to Cluster-Robust Inference, 2015,§II.A–II.C、§VI,群内依赖和少群问题;此文提供统计单位背景,不承担本页新实体学习风险定理。