Skip to content

重要性采样

Importance sampling · 重要抽样

从易采样的提议分布取样,以目标和提议的密度比修正访问频率并估计目标积分。

领域
统计学
条目类型
方法

形式陈述 ​

设目标概率测度为 P,提议概率测度为 Q,二者定义在同一可测空间 (X,F)。若 P≪Q,则Radon–Nikodym 导数

w(x)=dPdQ(x)

是重要性权重。对 P 可积的 f:X→R,有换测度恒等式

I=EP[f(X)]=EQ[w(X)f(X)].

从提议 Q 独立抽取 X1,…,XN,标准估计量为

I^N=1N∑i=1Nw(Xi)f(Xi).

它把后验计算中的目标期望转成普通Monte Carlo 积分。若 P,Q 对共同参考测度有密度 π,q,则 w=π/q;标准换测度要求 q(x)>0 覆盖所有满足 π(x)>0 的区域。只估计某个固定 f 时,覆盖 |f|π>0 是更弱的充分条件,但此时 π/q 不再是整个 P 相对 Q 的 Radon–Nikodym 导数。若只知道未归一化密度 γ 和常数 Z=∫γ(x)dx,则 π=γ/Z。只有 Z 已知时才能直接使用 w=γ/(Zq);否则 γ/q 的样本均值估计的是 ∫fγ,不是 Eπf。

在 Xi∼iidQ 且 EQ|wf|<∞ 时,I^N 无偏并几乎必然一致。若

EQ[w2f2]<∞,

则其方差为 VarQ(wf)/N,并在常规条件下满足中心极限定理。二阶矩不有限时,无偏性和大数律可能仍成立,但 N−1/2 标准误、样本方差和正态误差条不再有依据。若 Z 未知,可改用同属重要性加权方法的自归一化重要性采样;代价是有限样本偏差。

直觉

提议分布决定“去哪里看”,权重决定“每次看见算多少”。若 Q 比目标更常访问某一区域,w 小于一会把过度访问折回去;若 Q 很少进入目标质量大的区域,偶然抵达时就产生巨大权重。换测度恒等式保证平均后恢复目标积分,却不保证这种补偿稳定。

权重本身不是概率:它可以大于 1,而标准估计中的权重和也不必恰等于 N。已知归一化常数时再把权重强行除以样本权重和,会把无偏的均值估计改成一个随机分母的比值估计,两者有限样本性质不同。

理想提议不是笼统地“接近目标”。对特定积分 I=EPf,渐近方差取决于 wf;在可行的绝对连续密度中,普通估计量的方差最小形式与 |f|π 成比例,且当 f 同号时可达到零方差。自归一化估计的渐近最优形式则指向 |f−I|π。这些形式往往依赖未知答案,实际用途是说明提议应覆盖对当前函数真正重要的区域,而不是只追求目标密度峰值。

重要性权重重构目标质量
例子与边界

令三点后验在 a,b,c 上的概率为

π=(0.1,0.3,0.6),f=(0,1,2),

所以真值 I=0.1×0+0.3×1+0.6×2=1.5。取提议 q=(0.5,0.25,0.25),权重依次为 (0.2,1.2,2.4)。一次实际样本恰为 (a,b,c) 时,三个加权函数值是 (0,1.2,4.8),故

I^3=0+1.2+4.83=2.

这轮高估不是公式失效,而是提议把概率质量过多放在贡献为零的 a,一旦抽到稀少的 c 就用 2.4 倍权重补偿。重复独立运行后均值仍回到 1.5。

可以直接算出单次加权贡献的二阶矩为 0.25(1.2)2+0.25(4.8)2=6.12,方差为 6.12−1.52=3.87,因此三次抽样均值的方差为 1.29。若能直接从目标抽样,则 Eπf2=2.7,三次均值的方差只有 (2.7−2.25)/3=0.15;这个提议反而让方差增大到原来的 8.6 倍。“重要性”这个名称不保证降低方差。

对同一批 (a,b,c) 样本,自归一化结果则为 (0+1.2+4.8)/(0.2+1.2+2.4)=30/19≈1.579。本次更靠近真值并不能证明它总是更好;它使用了不同的随机估计规则。

支持遗漏会造成不可修复的偏差。若改成 q(c)=0,无论样本量多大都看不到目标中 60% 的质量;不存在有限权重能替代从未发生的访问。即使支持完整,方差也可能无穷。取 π(x)=e−x、q(x)=2e−2x,x≥0,则 w(x)=ex/2 且 EQw=1,但

EQ[w2]=∫0∞π(x)2q(x)dx=12∫0∞1dx=∞.

此时估计常数 1 仍无偏,典型运行却会长时间显得稳定,随后被一次尾部样本推翻。用有限批次算出的“小标准误”不能诊断尚未出现的巨权重。

推论与应用

重要性采样把采样器与目标模型解耦:同一批提议样本可对多个函数复用,似然改变后也可在重叠充分时重加权。逻辑链是先验证支撑,再计算未归一化比值,最后用目标积分对应的矩条件判断误差;顺序不能倒过来。

序贯方法把一次换测度拆成多个相邻分布之间的温和修正,从而避免单步权重跨度过大;但每一步仍继承支撑与尾部条件。诊断上,最大归一化权重和权重有效样本量可揭示集中程度,却不能证明遗漏的模态不存在。真正的可靠性来自提议覆盖、有限相关矩以及多种提议或重复运行之间的一致结果。

参考资料
  • Christian P. Robert and George Casella, Monte Carlo Statistical Methods, 2nd ed., Springer, 2004, Ch. 3, importance sampling.
  • Art B. Owen, Monte Carlo Theory, Methods and Examples, 2013,Ch. 9, Importance sampling,换测度、方差与自归一化估计。
  • Jun S. Liu, Monte Carlo Strategies in Scientific Computing, Springer, 2001, §2.5, weighted sampling.
关系图谱12 个相邻概念 · 4 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

暂未标注直接上位概念。

下位 / 直接特例

类型化关系