形式陈述
设目标概率测度为 ,提议概率测度为 ,二者定义在同一可测空间 。若 ,则Radon–Nikodym 导数公理库Radon–Nikodym 定理Radon–Nikodym theorem在标准 σ-有限条件下,把绝对连续测度表示为参考测度的积分密度。
是重要性权重。对 可积的 ,有换测度恒等式
从提议 独立抽取 ,标准估计量为
它把后验计算公理库后验计算Posterior computation · Bayesian computation从先验与似然给出的未归一化后验出发,计算归一化常数、后验期望、概率、样本或可控近似的任务框架。中的目标期望转成普通Monte Carlo 积分公理库Monte Carlo 积分Monte Carlo integration · Monte Carlo quadrature将积分改写为随机变量期望,以独立样本均值估计并用方差和概率假设量化随机误差。。若 对共同参考测度有密度 ,则 ;标准换测度要求 覆盖所有满足 的区域。只估计某个固定 时,覆盖 是更弱的充分条件,但此时 不再是整个 相对 的 Radon–Nikodym 导数。若只知道未归一化密度 和常数 ,则 。只有 已知时才能直接使用 ;否则 的样本均值估计的是 ,不是 。
在 且 时, 无偏并几乎必然一致。若
则其方差为 ,并在常规条件下满足中心极限定理。二阶矩不有限时,无偏性和大数律可能仍成立,但 标准误、样本方差和正态误差条不再有依据。若 未知,可改用同属重要性加权方法的自归一化重要性采样公理库自归一化重要性采样Self-normalized importance sampling · SNIS用未归一化目标与提议的权重和估计未知归一化常数,并以归一化权重形成目标期望的比率估计量。;代价是有限样本偏差。
直觉
提议分布决定“去哪里看”,权重决定“每次看见算多少”。若 比目标更常访问某一区域, 小于一会把过度访问折回去;若 很少进入目标质量大的区域,偶然抵达时就产生巨大权重。换测度恒等式保证平均后恢复目标积分,却不保证这种补偿稳定。
权重本身不是概率:它可以大于 1,而标准估计中的权重和也不必恰等于 。已知归一化常数时再把权重强行除以样本权重和,会把无偏的均值估计改成一个随机分母的比值估计,两者有限样本性质不同。
理想提议不是笼统地“接近目标”。对特定积分 ,若 ,按前述只覆盖固定积分贡献的约定, 最小化普通估计量的方差,其单次贡献方差为 ; 同号时等于零。若 ,则 在目标下几乎处处成立,积分本身已为零。
若仍要求整个 ,还须检查 是否覆盖目标:当 时,它不满足这一要求。此时对 可用 恢复完整覆盖,并在 时逼近上述方差下界;不能把不覆盖的 称作这个可行类中已经取得的最优解。当 时,自归一化估计的渐近最优候选与 成比例,也须检查覆盖;存在零贡献区域时,通常同样只能通过覆盖提议逼近。此类候选往往依赖未知答案,实际用途是说明提议应照顾当前函数的贡献,而不是只追求目标密度峰值。
重要性权重重构目标质量
例子与边界
令三点后验在 上的概率为
所以真值 。取提议 ,权重依次为 。一次实际样本恰为 时,三个加权函数值是 ,故
这轮高估不是公式失效,而是提议把概率质量过多放在贡献为零的 ,一旦抽到稀少的 就用 倍权重补偿。重复独立运行后均值仍回到 。
可以直接算出单次加权贡献的二阶矩为 ,方差为 ,因此三次抽样均值的方差为 。若能直接从目标抽样,则 ,三次均值的方差只有 ;这个提议反而让方差增大到原来的 倍。“重要性”这个名称不保证降低方差。
对同一批 样本,自归一化结果则为 。本次更靠近真值并不能证明它总是更好;它使用了不同的随机估计规则。
支持遗漏会造成不可修复的偏差。若改成 ,无论样本量多大都看不到目标中 的质量;不存在有限权重能替代从未发生的访问。即使支持完整,方差也可能无穷。取 、,,则 且 ,但
此时估计常数 仍无偏,典型运行却会长时间显得稳定,随后被一次尾部样本推翻。用有限批次算出的“小标准误”不能诊断尚未出现的巨权重。
推论与应用
重要性采样把采样器与目标模型解耦:同一批提议样本可对多个函数复用,似然改变后也可在重叠充分时重加权。逻辑链是先验证支撑,再计算未归一化比值,最后用目标积分对应的矩条件判断误差;顺序不能倒过来。
序贯方法把一次换测度拆成多个相邻分布之间的温和修正,从而避免单步权重跨度过大;但每一步仍继承支撑与尾部条件。诊断上,最大归一化权重和权重有效样本量可揭示集中程度,却不能证明遗漏的模态不存在。真正的可靠性来自提议覆盖、有限相关矩以及多种提议或重复运行之间的一致结果。
离策略评价公理库离策略评价与逐步重要性采样Off-policy evaluation · OPE · Per-decision importance sampling · PDIS · 离策略评估用行为策略记录的轨迹评价固定目标策略,证明前缀权重的无偏性,并计算长期权重和回报协方差的代价。把这里的单次换测度应用到决策轨迹:每笔奖励只乘截至它发生时的前缀比值。该课程证明无偏性,并分别计算逐步权重减少总方差的例子、总方差反而增加的反例和长时域的指数方差代价。
参考资料
- Christian P. Robert and George Casella, Monte Carlo Statistical Methods, 2nd ed., Springer, 2004, Ch. 3, importance sampling.
- Art B. Owen, Monte Carlo Theory, Methods and Examples, 2013,Ch. 9, Importance sampling,换测度、方差与自归一化估计。
- Jun S. Liu, Monte Carlo Strategies in Scientific Computing, Springer, 2001, §2.5, weighted sampling.