“构造重要性加权估计 $$ \widehat\ell {t,i}=\frac{\ell {t,i}\mathbf 1[I t=i]}{p {t,i}}; $$”
形式陈述
在对抗赌博机中,学习器用历史可测的动作分布采样一个坐标,再以逆 propensity 构造关于本轮随机性的无偏估计。
第
沿用模型页
因此一个坐标的观测可为所有坐标提供条件无偏估计:未选坐标记零,选中坐标按其逆采样概率放大。
直觉
有
例子与边界
二阶矩与探索
直接计算得
可测性与边界
推论与应用
例如
同一逆 propensity 思路也用于上下文 bandit 的离线策略评价。若日志策略缺乏 overlap,估计器要么无定义、要么方差巨大;裁剪和 doubly robust 修正会交换偏差与方差,必须单独计入误差。
参考资料
- Peter Auer et al., The Nonstochastic Multiarmed Bandit Problem, SIAM Journal on Computing, 2002.
- Sébastien Bubeck, Nicolò Cesa-Bianchi, Regret Analysis of Stochastic and Nonstochastic Multi-armed Bandit Problems, Foundations and Trends in Machine Learning, 2012.
- Tor Lattimore and Csaba Szepesvári, Bandit Algorithms, Cambridge University Press, 2020,§11.2,重要性估计及定理 11.2。