Skip to content

在线学习协议

Online learning protocol

学习器按轮先行动、再接收结果与反馈的序贯决策协议。

交互次序

t=1,,T,学习器根据历史 Ht1 选择动作或预测 at;环境随后揭示标签、结果或损失,学习器承担 t(at)。动作必须在本轮结果揭示前提交,否则问题退化为事后选择。

全信息反馈会揭示整条损失向量 t;bandit 反馈只揭示被选动作的损失;标签反馈介于两者之间。反馈多少直接决定可用估计器和遗憾界,不能只写“在线”便省略。

形式上,学习器的决策规则是从可观察历史到动作分布的映射。若当前上下文 xt 在行动前揭示,则规则可依赖 (Ht1,xt);当前标签或损失仍不在这个 σ-代数中。损失发生后,反馈映射 Φt(at,t) 决定加入历史的是整向量、一个坐标还是标签。

评价和反馈分层

协议只规定谁先知道什么,不自行规定成功标准。相同全信息协议可以用累计错误、外部遗憾或动态遗憾评价;相同遗憾定义放到 bandit 反馈下又会有更难的估计问题。因此“模型 = 时序 + 反馈 + 环境权限”,“目标 = 与何种比较器比较”,两层应在定理前分别固定。

环境不必 IID。Oblivious 对手预先固定整个序列;non-anticipating 自适应对手可依赖历史但不能看到本轮尚未实现的随机动作后再设损失。随机算法的保证必须说明概率包含学习器随机性以及环境是否随机。

在线学习评价预测质量,区别于输入逐个到达但只关心运行时间的在线算法,也区别于一次训练后静态部署。其核心评价见遗憾;错误界和 bandit 是不同反馈与损失的专门分支。

以天气预测为例,早晨学习器先根据此前记录给出“下雨概率”,傍晚才看到当天结果并承担损失。若当天真实天气在预测前已公开,问题没有学习难度;若只告诉预测是否正确而不揭示真实标签,反馈又比标准标签反馈更弱。协议中的先后顺序不是叙事细节,而是决定信息可用性的数学条件。

上下文 xt 的出现时机也要写清。在线分类通常先见 xt、再预测 yt、最后见标签;在线凸优化则先选 xt、后见损失函数。对自适应对手,高概率保证还要说明对手能否看到学习器过去的随机选择。把这些版本混为一个 Ht1,会在条件期望中错误使用尚未揭示的信息。

参考资料
  • Cesa-Bianchi, Lugosi, Prediction, Learning, and Games, 2006.
  • Shalev-Shwartz, “Online Learning and Online Convex Optimization,” 2012.