Skip to content

模型Model

在线学习协议

Online learning protocol

学习器按轮先行动、再接收结果与反馈的序贯决策协议。

形式陈述 ​

因果交互次序 ​

在线学习面对一条按时间展开的序列。对 t=1,…,T,学习器根据历史 Ht−1 选择动作或预测 at;环境随后揭示标签、结果或损失,学习器承担 ℓt(at)。动作必须在本轮结果揭示前提交,否则问题退化为事后选择。

反馈映射 ​

全信息反馈会揭示整条损失向量 ℓt;bandit 反馈只揭示被选动作的损失。标签反馈的强弱取决于已知的损失规则:在标准监督分类中,看见真实标签后可以计算每个候选预测的损失,因而通常足以恢复本轮全信息;在更一般的决策问题中则未必如此。判断反馈强弱,要检查能否从反馈重建其他动作的损失,不能只比较反馈名称。

形式上,学习器的决策规则是从可观察历史到动作分布的映射。若当前上下文 xt 在行动前揭示,则规则可依赖 (Ht−1,xt);当前尚未揭示的标签或损失不能作为这条规则的输入。损失发生后,反馈映射 Φt(at,ℓt) 决定加入历史的是整向量、一个坐标还是标签。

环境权限 ​

环境不必 IID。Oblivious 对手预先固定整个序列;non-anticipating 自适应对手可依赖历史,但不能看到本轮尚未实现的随机动作后再设损失。随机算法的保证必须说明概率包含学习器随机性以及环境是否随机。

直觉

协议只规定谁先知道什么,不自行规定成功标准。相同全信息协议可以用累计错误、外部遗憾或动态遗憾评价;相同遗憾定义放到 bandit 反馈下又会有更难的估计问题。因此“模型 = 时序 + 反馈 + 环境权限”,“目标 = 与何种比较器比较”,两层应在定理前分别固定。

在线学习评价预测质量,区别于输入逐个到达但只关心运行时间的在线算法。它也不同于统计学习问题的典型批量接口:后者先取得一个训练样本再评价总体风险,本页则把每轮行动、揭示与反馈的因果次序写进模型。其核心评价见遗憾;错误界和 bandit 是不同反馈与损失的专门分支。

可以把每轮看成一次封口承诺:学习器先把动作放进信封,环境再打开本轮结果。反馈决定信封打开后能看见多少,比较器决定赛季结束时拿谁作为参照。只要这两个层次中有一个含混,所谓“在线保证”就无法判断究竟利用了什么信息、战胜了什么基准。

行动、揭示与反馈的因果顺序
例子与边界

天气预测 ​

以天气预测为例,早晨学习器先根据此前记录给出“下雨概率”,傍晚才看到当天结果并承担损失。若当天真实天气在预测前已公开,预测就失去原本的信息限制。

“只告知是否猜对”不一定比标签反馈弱。二分类中,若预测为 0,反馈“错”便确定真实标签为 1;反馈“对”则确定为 0。预测和正确性合起来完整恢复标签。三分类才出现不同:预测为 1 而反馈“错”,只知道标签在 {2,3} 中,无法分别算出预测 2 与 3 的损失。这个逐步恢复过程说明,反馈是否丢失信息取决于动作、标签空间与损失的共同结构。

上下文与损失的揭示时机 ​

上下文 xt 的出现时机也要写清。在线分类通常先见 xt、再预测 yt、最后见标签;在线凸优化则先选 xt、后见损失函数。对自适应对手,高概率保证还要说明对手能否看到学习器过去的随机选择。把这些版本混为一个 Ht−1,会在条件期望中错误使用尚未揭示的信息。

协议也不负责保证可预测性。若环境可在看到本轮随机动作后专门给它最大损失,任何比较都可能被这种预知能力扭曲;若只观察过去,学习器的内部随机性仍能在正确的过滤下分析。对手权限因此是概率证明的边界,不是背景叙述。

重复博弈中的完整反馈 ​

在重复有限博弈中,知道自己的收益表并观察对手当轮动作,就能计算自己每个候选动作本来会得到什么收益,因此这可以构成全信息反馈。若只看见实际取得的一个收益数,通常就无法重建这条向量。乘法权重的博弈保证依赖的是可重建性,而不是“大家都看到了比赛结果”这样的宽泛说法。

随机抽样还要求明确同轮的信息边界。各人可以根据共同历史调整分布,但在给定历史后独立抽样,才能把本人混合收益与实际收益之差视为条件均值为零的增量。若允许对手看见本人的当前抽样再回应,这一步不成立。输出若是实际动作的经验联合分布,就需要保留这项抽样误差;输出若是各轮独立乘积分布的平均,则需要获得完整期望收益向量。两种协议都能通向粗相关均衡,但概率保证与反馈要求不同。

推论与应用

在全信息有限动作协议下,学习器可以观察所有候选的损失并发展出专家建议与指数权重算法;在 bandit 反馈下,只见一个坐标,必须构造无偏或低偏损失估计器。两者可能使用同一个比较器,却因反馈不同而具有不同的维度或动作数依赖。

固定比较器的累计差导向遗憾;可实现在线分类把损失专门化为 0–1 错误,并研究 mistake bound;在线凸优化则把动作空间与损失函数赋予凸结构,以梯度反馈控制遗憾。先固定本页的时序接口,后续这些分支才能准确说明额外假设来自哪里。

参考资料
  • Nicolò Cesa-Bianchi and Gábor Lugosi, Prediction, Learning, and Games, Cambridge University Press, 2006.
  • Shai Shalev-Shwartz, “Online Learning and Online Convex Optimization”,第 1 节的逐轮协议与比较基准, Foundations and Trends in Machine Learning 4(2), 2012, pp. 107–194.
关系图谱37 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

暂未标注直接上位概念。

下位 / 直接特例

类型化关系