“在在线学习协议中,令专家索引组成有限集合 $[N]$。第 $t$ 轮学习器先选分布 $p t\in\Delta N$,损失向量 $\ell t\in[0,1]^N$ 随后揭示,学习器承受期望…”
形式陈述 ​
因果交互次序 ​
在线学习面对一条按时间展开的序列。对
反馈映射 ​
全信息反馈会揭示整条损失向量
形式上,学习器的决策规则是从可观察历史到动作分布的映射。若当前上下文
环境权限 ​
环境不必 IID。Oblivious 对手预先固定整个序列;non-anticipating 自适应对手可依赖历史,但不能看到本轮尚未实现的随机动作后再设损失。随机算法的保证必须说明概率包含学习器随机性以及环境是否随机。
直觉
协议只规定谁先知道什么,不自行规定成功标准。相同全信息协议可以用累计错误、外部遗憾或动态遗憾评价;相同遗憾定义放到 bandit 反馈下又会有更难的估计问题。因此“模型 = 时序 + 反馈 + 环境权限”,“目标 = 与何种比较器比较”,两层应在定理前分别固定。
在线学习评价预测质量,区别于输入逐个到达但只关心运行时间的在线算法。它也不同于统计学习问题的典型批量接口:后者先取得一个训练样本再评价总体风险,本页则把每轮行动、揭示与反馈的因果次序写进模型。其核心评价见遗憾;错误界和 bandit 是不同反馈与损失的专门分支。
可以把每轮看成一次封口承诺:学习器先把动作放进信封,环境再打开本轮结果。反馈决定信封打开后能看见多少,比较器决定赛季结束时拿谁作为参照。只要这两个层次中有一个含混,所谓“在线保证”就无法判断究竟利用了什么信息、战胜了什么基准。
例子与边界
天气预测 ​
以天气预测为例,早晨学习器先根据此前记录给出“下雨概率”,傍晚才看到当天结果并承担损失。若当天真实天气在预测前已公开,问题没有学习难度;若只告诉预测是否正确而不揭示真实标签,反馈又比标准标签反馈更弱。协议中的先后顺序不是叙事细节,而是决定信息可用性的数学条件。
上下文与损失的揭示时机 ​
上下文
协议也不负责保证可预测性。若环境可在看到本轮随机动作后专门给它最大损失,任何比较都可能被这种预知能力扭曲;若只观察过去,学习器的内部随机性仍能在正确的过滤下分析。对手权限因此是概率证明的边界,不是背景叙述。
推论与应用
在全信息有限动作协议下,学习器可以观察所有候选的损失并发展出专家建议与指数权重算法;在 bandit 反馈下,只见一个坐标,必须构造无偏或低偏损失估计器。两者可能使用同一个比较器,却因反馈不同而具有不同的维度或动作数依赖。
固定比较器的累计差导向遗憾;可实现在线分类把损失专门化为 0–1 错误,并研究 mistake bound;在线凸优化则把动作空间与损失函数赋予凸结构,以梯度反馈控制遗憾。先固定本页的时序接口,后续这些分支才能准确说明额外假设来自哪里。
参考资料
- Nicolò Cesa-Bianchi and Gábor Lugosi, Prediction, Learning, and Games, Cambridge University Press, 2006.
- Shai Shalev-Shwartz, “Online Learning and Online Convex Optimization,” Foundations and Trends in Machine Learning 4(2), 2012, pp. 107–194.