Skip to content

赌博机重要性加权估计

importance-weighted bandit estimator · inverse propensity estimator

把单个被选臂的反馈放大为完整损失向量的条件无偏估计。

条目类型
定义

形式陈述

对抗赌博机中,学习器用历史可测的动作分布采样一个坐标,再以逆 propensity 构造关于本轮随机性的无偏估计

t 轮根据历史 Ft1 选择分布 pt,抽取 Itpt,只观察 t,It。对每个臂定义

^t,i=t,i1{It=i}pt,i.

只要 pt,i>0,条件于过去和当轮损失向量,

E[^t,iFt1]=t,ipt,iPr(It=iFt1)=t,i.

因此一个坐标的观测可为所有坐标提供条件无偏估计:未选坐标记零,选中坐标按其逆采样概率放大。

直觉

K 个臂且 pt,i=1/K 时,若选中臂 i,估计为 Kt,i;否则为零。它的均值仍是 t,i,却以低概率取大值。这不是换数字的演示,而是揭示 bandit 反馈的核心代价:为了从稀疏观测恢复全向量,必须支付方差。

稀疏反馈的无偏向量估计
例子与边界

二阶矩与探索

直接计算得

E[^t,i2Ft1]=t,i2pt,i.

pt,i 越小,二阶矩越大;若为零,估计甚至不可定义。EXP3 等算法因而混入显式均匀探索以给概率下界,或使用 implicit exploration 的有偏/平滑估计来控制尾部。无偏不等于低误差,势函数证明必须保留这一方差项。

可测性与边界

pt 必须相对过去可测,It 再按该分布抽样,才能写出上述条件期望。若损失会在看见当轮随机动作后再被对手选择,需明确 adversary 类型,简单条件无偏式可能改变。该估计只完成反馈重建;EXP3 的权重更新与 regret 推导是下一层内容,不能由“无偏”一句话自动得到。

推论与应用

EXP3 把该估计送入指数权重势函数:一阶项因条件无偏恢复真实损失,二阶项则留下约 1/pt,i 的方差代价。显式或隐式探索正是为了控制这一代价,而不是额外的经验技巧。

同一逆 propensity 思路也用于上下文 bandit 的离线策略评价。若日志策略缺乏 overlap,估计器要么无定义、要么方差巨大;裁剪和 doubly robust 修正会交换偏差与方差,必须单独计入误差。

参考资料
关系图谱14 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组