Skip to content

方法Method

滚动起点验证与信息可用时间

Rolling-origin validation · Forecast-origin evaluation · 滚动预测起点评价

按每个预测起点当时真正可用的信息重建训练资料,分别核算预测步长、标签成熟时间、重叠窗口和多次重拟合成本。

形式陈述 ​

预测明天时不能使用后天才发布的资料。它沿用留出法的训练与评价隔离,但要重建每一时点的信息集合。滚动起点验证依次回到历史时刻,重建那个时刻能够运行的完整预测流程,再等待对应结果成熟后计分。它比把文件按日期排序多一项要求:每个数值要有真正的可用时间。

设 Ft 表示预测起点 t 当时已公开的信息,包括历史已成熟标签、当时版本的特征、预先固定的随机种子和过去允许看到的评价反馈。预测 y^t,h应只依赖 Ft,目标是未来 Yt+h,步长 h为正整数。

用监督样本 (Xs,Ys+h)训练时,记特征版本的可用时刻为 aX(s)、标签可用时刻为 aY(s+h),训练索引至少应满足

(1)It,h={s:aX(s)≤t, aY(s+h)≤t}.

还可在其中限制最近 w个可用样本,形成固定窗;或保留全部,形成扩展窗。特征是否符合预测任务还要核对:Xs必须是当时预测 Ys+h可用的版本,不能把后续修订值回填给历史模型。所有需学习的预处理也在该起点合法训练侧重新拟合。

对预先选定的有限非空起点集合 Oh,定义按步长分别报告的经验损失

(2)R^h=1|Oh|∑t∈Ohℓ(y^t,h,Yt+h).

这是指定起点、窗口、更新频率和步长下的风险评价对象。没有平稳性或迁移假设时,它不自动等于未来某一时点的风险;它首先是一份诚实的历史回放。

直觉

一个业务日期可能有三个不同时间:事件发生、标签最终确定、数据对预测系统可见。真正决定能否训练的是后两者。随机打乱资料容易借到未来信息;只按事件日期切分,也可能让尚未成熟的标签偷偷越过边界。

滚动起点像反复按下“当时重放”。每次都从当时的资料训练,只使用当时可见的输入生成预测。一个模型在起点3预测第5天,与在起点4预测第5天拥有不同信息,它们是两个不同步长任务。

例子与边界

发布延迟一日的八点回放 ​

八天真实值为

(Y1,…,Y8)=(1,2,3,5,4,6,7,8).

Yj在第 j+1天末才可见,预测均在起点 t当日晚间发出,所以最新可用值是 Yt−1。预先比较两种规则:甲报最新可用值,乙报最近两个可用值的平均。两者都把这一个水平预测用于 h=1,2。起点固定为3、4、5、6。

起点 t 最新可用值 甲预测 乙预测 Yt+1 Yt+2
3 Y2=2 2 3/2 5 4
4 Y3=3 3 5/2 4 6
5 Y4=5 5 4 6 7
6 Y5=4 4 9/2 7 8

采用平方损失,甲在一步、两步的四项损失分别为 (9,1,1,9)、(4,9,4,16),所以

R^1(甲)=5,R^2(甲)=33/4.

乙的一步损失为 (49/4,9/4,4,25/4),两步为 (25/4,49/4,9,49/4),从而

R^1(乙)=99/16,R^2(乙)=159/16.

在这份回放中甲在两种步长都更好。若把这些结果拿来选甲,它们就是选择依据;不能又宣称是选中规则的全新独立测试。

如果错把尚未发布的 Yt当成已知,甲的一步预测变成 (3,5,4,6),损失为 (4,1,4,1),平均2.5。这个更漂亮的数对应一项当时做不到的任务。

标签窗口重叠:按行日期留出仍可能泄漏 ​

另一个任务在起点 s预测未来两日总量 Zs=Ys+1+Ys+2。单日值同样延迟一日发布,因此标签 Zs到 s+3才完全成熟。若要在 t=6重新训练,合法标签必须满足 s≤3。

只用“样本起点早于6”会把 s=4,5也放进训练,但它们分别包含 Y6,Y7,在起点6并未全部可见。删除这些未成熟样本来自具体可用时刻,不是一个可任意照搬的“间隔两行”魔法。

相邻的 Zs,Zs+1还共同含 Ys+2。即使每次训练都合法,最终回放损失也可能相关。删除训练边界附近的行能阻断特定信息穿越,并不会让所有相邻预测误差变成独立。对于不规则采样,应按实际日期区间检查交叠,而不靠固定行数代替时长。

推论与应用

可用信息、目标和误差要分别审计 ​

诚实回放保证每个预测是 Ft可测。于是条件风险可以定义为

rt,h=E[ℓ(y^t,h,Yt+h)∣Ft].

在可积条件下,全期望给 ER^h=|Oh|−1∑tErt,h。这个平均可能随时间改变,不等于“永远稳定”的单个总体风险。各项损失共享资料、目标或环境,普通IID标准误与逐行Hoeffding界没有自动依据。要做区间,需给出适用的依赖、平稳或序贯条件;仅画出向前箭头不算证明。

若上线每天更新一次,回放也应每天更新;若上线每月冻结,回放每一天重训会评价另一种算法。窗口长度、遗忘系数、特征处理和校准规则,都应只通过当时允许的开发资料选择。跨时间比较若同时涉及重复实体,还需结合新实体与已见实体目标,记录谁的历史能被访问。

调参与成本 ​

本例两条规则、四个起点,每条规则在每个起点算一次水平,共8次参数更新;每次产生两个步长的预测,共16个“起点—步长”输出。甲取最新值、乙更新二项和都可常数时间完成,但不能因此把一般模型的重拟合成本也记为常数。

若有 M候选、T个起点,各自从头拟合一个共享多步模型,需 MT次拟合;若每个步长训练独立模型,通常还要乘 H。暖启动或增量更新可以降低实际费用,但应保存等价更新条件和每次可用数据。比较不同方法时,应同时报模型拟合、预测数量和实际时间,不能只比较“跑了四折”。

可以先在较早的一组起点调参,锁定流程后在较晚起点回放;或每个外层起点内部只用更早已成熟资料重新调参。后者评价持续学习流程,内部搜索成本也需逐轮累计。无论采用哪种方式,都不能在最晚窗口发现变化后回头修改早期预测,并将修改后的结果说成实时表现。

自测与答案 ​

  1. 标签 Ys+3发布延迟两日,在 t=10拟合时最大的合法样本起点是多少?答案:s+3+2≤10,故 s≤5。
  2. 两个起点预测同一天的值,能否合成一个不标注步长的误差?可以先指定一个业务加权目标再汇总,但不能把它当成单一一步预测任务;报告时应保留步长构成。

给冻结规则的损失均值加上依赖尺度 ​

完成信息可用时间审计后,若评价的是已冻结规则,且另有适用的平稳弱依赖模型,HAC协方差估计可以把有序损失或损失差的滞后协方差转成均值标准误。该页给出高斯有限MA均值的明确保证;它不能自动覆盖本页随起点重训、持续调参或结构突变的流程。诚实回放与依赖区间的模型条件仍是两项不同责任。

参考资料
关系图谱8 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系