Skip to content

定义Definition

赌博机重要性加权估计

importance-weighted bandit estimator

把单个被选臂的反馈放大为完整损失向量的条件无偏估计。

形式陈述 ​

在对抗赌博机中,学习器用历史可测的动作分布采样一个坐标,再以逆 propensity 构造关于本轮随机性的无偏估计。

第 t 轮根据历史 Ft−1 选择分布 pt,抽取 It∼pt,只观察 ℓt,It。对每个臂定义

ℓ^t,i=ℓt,i1{It=i}pt,i.

沿用模型页 Gt=σ(Ft−1,pt,ℓt),非预见抽样满足 Pr(It=i∣Gt)=pt,i。只要 pt,i>0,条件于过去与当轮损失向量,

E[ℓ^t,i∣Gt]=ℓt,ipt,iPr(It=i∣Gt)=ℓt,i.

因此一个坐标的观测可为所有坐标提供条件无偏估计:未选坐标记零,选中坐标按其逆采样概率放大。

直觉

有 K 个臂且 pt,i=1/K 时,若选中臂 i,估计为 Kℓt,i;否则为零。它的条件均值仍是 ℓt,i,却以低概率取大值。稀疏观测在平均意义上恢复了整行,单轮误差却可能很大。

稀疏反馈的无偏向量估计
例子与边界

二阶矩与探索 ​

直接计算得

E[ℓ^t,i2∣Gt]=ℓt,i2pt,i.

pt,i 越小,二阶矩越大;若为零,估计甚至不可定义。显式均匀探索能给概率下界,implicit exploration 则改变分母、引入偏差以控制尾部;它们不是本页无偏恒等式的一部分。规范损失版 EXP3 可不混合探索:概率加权二阶矩的条件均值为 ∑ipt,iℓt,i2/pt,i=∑iℓt,i2≤K,足以支持其固定比较器期望界。

可测性与边界 ​

Gt 是分析用信息,学习器并不观察整行 ℓt。若只条件于过去,塔式法则给出 E[ℓ^t,i∣Ft−1]=E[ℓt,i∣Ft−1];只有损失已对过去可测时,右端才直接等于 ℓt,i。这是条件期望中可测性条件的实际用途。若对手看见 It 后才选损失,Pr(It=i∣Gt)=pt,i 可能失效。该估计只完成反馈重建,不自动证明 EXP3 的遗憾界。

推论与应用

例如 pt=(1/4,3/4)、ℓt=(1,1/3)。选臂 1 时估计为 (4,0),选臂 2 时为 (0,4/9);按概率平均得到 (1,1/3),第一坐标二阶矩为 4。这个有限枚举同时检查无偏性与小概率导致的大二阶矩。

同一逆 propensity 思路也用于上下文 bandit 的离线策略评价。若日志策略缺乏 overlap,估计器要么无定义、要么方差巨大;裁剪和 doubly robust 修正会交换偏差与方差,必须单独计入误差。

参考资料
关系图谱11 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

被这些条目使用