Skip to content

定理Theorem

Varadhan 积分引理

Varadhan integral lemma

由大偏差速率计算指数积分的主导增长率,把概率成本与指数奖励相减后最大化。

形式陈述 ​

若每个状态获得指数级奖励,哪些状态主导期望值?最常见状态不一定获胜,奖励可以补偿它的概率成本。

设 Xn 在Polish 空间上以速度 an→∞、良速率 I 满足LDP。对有界连续实函数 f,Varadhan 积分引理给出

limn→∞1anlog⁡Eeanf(Xn)=supx{f(x)−I(x)}.

若 f 无界但连续,一个足够的尾部条件是

limM→∞lim supn1anlog⁡E[eanf(Xn)1{f(Xn)>M}]=−∞.

满足它时仍可用同一公式。这里控制的是加权后的指数尾积分,不只是 P(f(Xn)>M)。

直觉

概率约为 e−anI(x),奖励约为 eanf(x),相乘后贡献约为 ean(f−I)。在指数尺度上,求和或积分会挑出最大的净增长指数,因此最优化对象是 f−I。

下界可固定一个点 x,在其小邻域内让 f 接近 f(x),再使用 LDP 开集下界。对所有 x 优化便得到 sup(f−I)。上界将有界 f 的值域切成有限小段,对每段用闭集上界,有限项之和取最大指数;细分误差最后趋零。无界情形还需先截断奖励,再用上面的尾条件移除截断。

例子与边界

令 Xn 是 Bernoulli(p) 样本均值,其中 0<p<1,I(x)=D(x‖p) 在 [0,1] 上。取 f(x)=θx,在这个紧区间上有界,则

sup0≤x≤1{θx−D(x‖p)}=log⁡(1−p+peθ).

求导令 θ=log⁡(x(1−p)/(p(1−x))),得到主导位置

xθ=peθ1−p+peθ.

代回后得到右侧。还可以直接核验:EenθXn=(1−p+peθ)n。两条计算吻合,说明指数奖励把主导经验比例从 p 移到 xθ。

无界奖励若没有尾控制会失败。令 P(Xn=n)=e−n2,其余质量在零。速度 n 下,Xn 的良速率为 I(0)=0、其他位置为无穷。取连续函数 f(x)=x2,变分右侧为零;但

Eenf(Xn)=1−e−n2+en3−n2,

其对数除以 n 趋于无穷。逃到极远处的概率虽然超指数小,奖励却更大。LDP 本身没有许可忽略这种被奖励放大的尾部。

积分引理也不给出最大点唯一性。若 f−I 有多个最大点,指数增长率仍确定,但质量在这些点间怎样分配需要更细的信息。

推论与应用

例如取有界连续 f,将原分布乘上 eanf 并归一化,得到倾斜分布。归一化常数的指数由本引理计算;在开集、闭集上重复同一积分估计,得到新良速率 I(x)−f(x)+supy(f(y)−I(y))。有界性还使新速率的有限子水平集包含在原速率的某个紧子水平集中。这把概率中的换测度与统计物理的能量、熵竞争连接起来。

参考资料
关系图谱19 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组