“冻结的预测规则产生的平稳损失或损失差序列,可以在合适依赖模型下使用同一均值接口。滚动起点验证若每次改变训练集或重选模型,损失序列未必平稳;仅仅按时间合法回放,不能直接援用本页固定MA均值证明…”
形式陈述
预测明天时不能使用后天才发布的资料。它沿用留出法的训练与评价隔离,但要重建每一时点的信息集合。滚动起点验证依次回到历史时刻,重建那个时刻能够运行的完整预测流程,再等待对应结果成熟后计分。它比把文件按日期排序多一项要求:每个数值要有真正的可用时间。
设
用监督样本
还可在其中限制最近
对预先选定的有限非空起点集合
这是指定起点、窗口、更新频率和步长下的风险评价对象。没有平稳性或迁移假设时,它不自动等于未来某一时点的风险;它首先是一份诚实的历史回放。
直觉
一个业务日期可能有三个不同时间:事件发生、标签最终确定、数据对预测系统可见。真正决定能否训练的是后两者。随机打乱资料容易借到未来信息;只按事件日期切分,也可能让尚未成熟的标签偷偷越过边界。
滚动起点像反复按下“当时重放”。每次都从当时的资料训练,只使用当时可见的输入生成预测。一个模型在起点3预测第5天,与在起点4预测第5天拥有不同信息,它们是两个不同步长任务。
例子与边界
发布延迟一日的八点回放
八天真实值为
| 起点 |
最新可用值 | 甲预测 | 乙预测 | ||
|---|---|---|---|---|---|
| 3 | 2 | 5 | 4 | ||
| 4 | 3 | 4 | 6 | ||
| 5 | 5 | 4 | 6 | 7 | |
| 6 | 4 | 7 | 8 |
采用平方损失,甲在一步、两步的四项损失分别为
乙的一步损失为
在这份回放中甲在两种步长都更好。若把这些结果拿来选甲,它们就是选择依据;不能又宣称是选中规则的全新独立测试。
如果错把尚未发布的
标签窗口重叠:按行日期留出仍可能泄漏
另一个任务在起点
只用“样本起点早于6”会把
相邻的
推论与应用
可用信息、目标和误差要分别审计
诚实回放保证每个预测是
在可积条件下,全期望给
若上线每天更新一次,回放也应每天更新;若上线每月冻结,回放每一天重训会评价另一种算法。窗口长度、遗忘系数、特征处理和校准规则,都应只通过当时允许的开发资料选择。跨时间比较若同时涉及重复实体,还需结合新实体与已见实体目标,记录谁的历史能被访问。
调参与成本
本例两条规则、四个起点,每条规则在每个起点算一次水平,共8次参数更新;每次产生两个步长的预测,共16个“起点—步长”输出。甲取最新值、乙更新二项和都可常数时间完成,但不能因此把一般模型的重拟合成本也记为常数。
若有
可以先在较早的一组起点调参,锁定流程后在较晚起点回放;或每个外层起点内部只用更早已成熟资料重新调参。后者评价持续学习流程,内部搜索成本也需逐轮累计。无论采用哪种方式,都不能在最晚窗口发现变化后回头修改早期预测,并将修改后的结果说成实时表现。
自测与答案
- 标签
发布延迟两日,在 拟合时最大的合法样本起点是多少?答案: ,故 。 - 两个起点预测同一天的值,能否合成一个不标注步长的误差?可以先指定一个业务加权目标再汇总,但不能把它当成单一一步预测任务;报告时应保留步长构成。
给冻结规则的损失均值加上依赖尺度
完成信息可用时间审计后,若评价的是已冻结规则,且另有适用的平稳弱依赖模型,HAC协方差估计可以把有序损失或损失差的滞后协方差转成均值标准误。该页给出高斯有限MA均值的明确保证;它不能自动覆盖本页随起点重训、持续调参或结构突变的流程。诚实回放与依赖区间的模型条件仍是两项不同责任。
参考资料
- Rob J. Hyndman and George Athanasopoulos, Forecasting: Principles and Practice, §5.10 Time Series Cross-validation, 3rd ed.,滚动起点、逐步扩展训练与多步误差。本文八点发布延迟与标签成熟算例为独立构造。
- scikit-learn developers, TimeSeriesSplit,
gap、max_train_size和等间隔样本下可比较测试时长的接口。软件的行数参数不能替代本文逐字段的实际可用时刻检查。