“学习中,Hoeffding 首先控制一个预先固定假设的经验风险;有限假设类界再用并集界形成所有假设同时成立的事件。若 $h$ 是看过同一训练集后才挑出的,直接把它当固定 $h$ 会遗漏选择偏…”
模型与算法 ​
有
其中
探索—利用图像 ​
经验均值代表已知收益,半径代表尚未排除的乐观空间。常拉的臂
次优臂拉取界 ​
令
以及伪遗憾
自适应样本数的严谨点 ​
边界 ​
参考资料
- Peter Auer, Nicolò Cesa-Bianchi, Paul Fischer, Finite-time Analysis of the Multiarmed Bandit Problem, Machine Learning, 2002.
- Tor Lattimore, Csaba Szepesvári, Bandit Algorithms, Cambridge University Press, 2020.