“Hedge 需要全损失反馈。只观察所选臂时,需重要性加权估计,方差项也会改变。Weighted Majority按二元错误乘固定因子并作多数表决;本页处理一般有界损失和混合损失。MWU则抽象…”
构造 ​
第
只要
因此一个坐标的观测可为所有坐标提供条件无偏估计:未选坐标记零,选中坐标按其逆采样概率放大。
均匀采样例子 ​
有
二阶矩与探索 ​
直接计算得
可测性与边界 ​
参考资料
- Peter Auer et al., The Nonstochastic Multiarmed Bandit Problem, SIAM Journal on Computing, 2002.
- Sébastien Bubeck, Nicolò Cesa-Bianchi, Regret Analysis of Stochastic and Nonstochastic Multi-armed Bandit Problems, Foundations and Trends in Machine Learning, 2012.