“构造重要性加权估计 $$ \widehat\ell {t,i}=\frac{\ell {t,i}\mathbf 1[I t=i]}{p {t,i}}; $$”
形式陈述 ​
在对抗赌博机中,学习器用历史可测的动作分布采样一个坐标,再以逆 propensity 构造关于本轮随机性的无偏估计。
第
只要
因此一个坐标的观测可为所有坐标提供条件无偏估计:未选坐标记零,选中坐标按其逆采样概率放大。
直觉
有
例子与边界
二阶矩与探索 ​
直接计算得
可测性与边界 ​
推论与应用
EXP3 把该估计送入指数权重势函数:一阶项因条件无偏恢复真实损失,二阶项则留下约
同一逆 propensity 思路也用于上下文 bandit 的离线策略评价。若日志策略缺乏 overlap,估计器要么无定义、要么方差巨大;裁剪和 doubly robust 修正会交换偏差与方差,必须单独计入误差。
参考资料
- Peter Auer et al., The Nonstochastic Multiarmed Bandit Problem, SIAM Journal on Computing, 2002.
- Sébastien Bubeck, Nicolò Cesa-Bianchi, Regret Analysis of Stochastic and Nonstochastic Multi-armed Bandit Problems, Foundations and Trends in Machine Learning, 2012.