Bandit 的本质是反馈缺失,而不是“有多个选项”。若每轮能看到全部臂结果,就是全信息专家问题公理库专家建议预测Prediction with expert advice在全信息反馈下组合多个专家,并与事后最好的固定专家比较。;学习器只有实际选择某臂,才能获得关于它的新证据,因此探索本身会消耗奖励。
目标也会分支。累计遗憾不愿频繁试差臂,最佳臂识别公理库最佳臂识别best-arm identification · pure exploration以可靠选出最高均值臂为目标,研究纯探索的停止规则与样本复杂度。却可牺牲过程奖励来降低最终推荐错误;报告“找到了最好臂”不能代替遗憾保证,反过来也一样。全信息、随机 bandit、对抗 bandit 与纯探索因而共享动作集合,却不能共享同一条性能定理。
参考资料
Sébastien Bubeck and Nicolò Cesa-Bianchi, “Regret Analysis of Stochastic and Nonstochastic Multi-armed Bandit Problems,” Foundations and Trends in Machine Learning 5(1), 2012, pp. 1–122.
Tor Lattimore, Csaba Szepesvári, Bandit Algorithms, Cambridge University Press, 2020, Chs. 4 and 11.