“EXP3的势函数与专家 Hedge 相似,但用 $\widehat\ell {t,i}$ 代替完整损失。无偏估计让一阶项恢复真实损失,二阶项则累积约 $K$ 的方差代价,优化学习率后出现 $…”
形式陈述 ​
损失版 EXP3 ​
在对抗赌博机模型中有
- 令
,按 抽取 ; - 构造重要性加权估计
- 按指数权重与 Hedge的形式更新
。
指数权重保持每个
这是一种不显式混合均匀探索的规范期望界版本;带参数
直觉
部分反馈的核心障碍是:算法既要把一个被抽中的坐标恢复成整行损失的无偏估计,又要承担由
势函数分析 ​
记
另一方面,对任意固定臂
合并并取条件期望。第一项实际等于已选臂损失,因为
于是对每个固定臂
对 oblivious 对手,损失序列固定,因此可在取期望后再对固定臂取最小。取
概率空间包含算法抽臂的全部随机性。对 non-anticipating adaptive adversary,
例子与边界
具体失败例子:把未观察损失直接记零 ​
设本轮
一个广告位的点击收益可能按新闻周期恶意变化,根本不存在固定均值 gap。EXP3 仍与事后最好固定广告比较,而 UCB 的置信均值论证没有适用对象。若环境真是平稳随机臂,EXP3 的最坏情形保证通常不如利用 gap 的 UCB 精细。
失败边界 ​
上述是期望遗憾,不是高概率界。无偏估计可能重尾,直接对同一分析套 Hoeffding 不成立;EXP3.P 通过显式探索和偏置项获得高概率控制,EXP3-IX 则修改分母。若对手见到本轮随机选择后才设损失,它可总让所选臂损失为
推论与应用
EXP3 把全信息指数权重方法接到部分反馈协议上,因此它一端通向遗憾与比较器类中的最好固定臂基准,另一端通向重要性估计的方差控制。若环境具有固定均值和 gap,应改用随机赌博机与伪遗憾的模型与算法;若需要高概率保证,则必须采用与采样分布、偏置估计相匹配的 EXP3.P 或 EXP3-IX 分析,不能只替换定理标题。
参考资料
- Peter Auer, Nicolò Cesa-Bianchi, Yoav Freund, and Robert E. Schapire, “The Nonstochastic Multiarmed Bandit Problem,” SIAM Journal on Computing 32(1), 2002, pp. 48–77.
- Sébastien Bubeck and Nicolò Cesa-Bianchi, “Regret Analysis of Stochastic and Nonstochastic Multi-armed Bandit Problems,” Foundations and Trends in Machine Learning 5(1), 2012, pp. 1–122.