“交叉验证和嵌套留出通过协议隔离模型选择与最终评价,适合轮数有限、流程可预先安排的任务。自适应数据分析处理的是更开放的交互:后续问题本身由先前结果塑造。把每轮探索都塞入一次普通交叉验证,不能自…”
三种数据角色 ​
模型开发包含三个不同问题:用什么数据拟合参数,用什么数据选择模型或超参数,以及用什么数据评价最终固定方案。训练集、验证集、测试集不是文件名,而是这三种统计角色。同一条样本可以在不同折中轮换角色,但若一个结果已参与选择,就不能再把它当作对该选择完全独立的最终证据。
最简单的留出法把 IID 样本随机分成训练集
可用普通集中不等式估计
折交叉验证 ​
把样本索引划分为
每条样本恰好被测试一次,训练数据却在各轮高度重叠。因此各折误差不是独立观测,不能把
模型选择与嵌套交叉验证 ​
若用交叉验证分数在候选集合
最小分数对其自身存在乐观选择偏差。候选越多、调参越反复,偶然低估越容易获胜。此分数适合选模型,却不再是最终方案的无偏独立评价。
嵌套交叉验证用外层折估计整个选择流程:每个外层训练部分内部再做一轮交叉验证选择
一个完整协议 ​
假设要在三种特征处理方式和十个正则强度间选择。先保留一次性测试集;在其余数据上进行交叉验证,且每一折内重新拟合标准化、缺失值处理和特征选择,再选出管线。随后用全部非测试数据重新拟合一次,最后只评价一次测试集。
若先在全数据上标准化或筛特征,再切折,测试折的信息已进入训练变换,形成数据泄漏。泄漏不一定表现为直接读取标签;用全体样本估计词表、时间窗口或归一化尺度,也可能让评估对象不再是实际部署时可用的训练流程。
时间、群组与分布边界 ​
随机折分默认样本可交换。时间序列应尊重因果顺序,常用滚动或向前验证;同一用户、病人或设备产生的多条记录应按群组切分,避免近重复实体跨越训练和测试。若部署分布与收集分布不同,即使切分完全独立,估计的仍是旧分布风险,不会自动覆盖分布漂移。
分类不平衡时可做分层切分以稳定各折类别比例,但分层不把条件抽样重新变成原始总体;报告指标时仍需说明目标先验和加权方式。极少数群组或稀有类别下,折数选择受实际可分样本数限制。
置信度与重复使用 ​
一次独立测试集支持固定模型的有限样本置信界。若团队根据测试结果继续改模型,再回来报告同一测试集,模型已经依赖测试反馈。此时要么取得新测试集,要么把旧测试集降格为验证数据,并用自适应数据分析机制明确管理复用。
重复多次随机交叉验证可以描述切分敏感性,但这些重复共享大量样本,不能把重复次数当作独立样本量。最可靠的报告会同时给出切分协议、评价对象、候选搜索范围和不确定性计算方法,而不是只给一个平均分。
参考资料
- Mervyn Stone, “Cross-Validatory Choice and Assessment of Statistical Predictions,” JRSS B, 1974.
- Trevor Hastie, Robert Tibshirani, and Jerome Friedman, The Elements of Statistical Learning, model assessment chapter.
- Sylvain Arlot and Alain Celisse, “A Survey of Cross-Validation Procedures for Model Selection,” Statistics Surveys, 2010.