Skip to content

证据下界

Evidence lower bound · ELBO · Variational lower bound

将对数边缘似然分解为任意辅助分布下的可计算期望与到真实后验的非负 KL 缺口。

领域
统计学
条目类型
定理

形式陈述

Bayesian 模型中,固定观测 x,设联合密度为 p(x,z),证据满足

0<p(x)=p(x,z)dz<.

取任意正规化密度 q(z)。若 q(z)>0 的地方都有 p(x,z)>0,且相关对数可积,定义证据下界

L(q)=Eq[logp(x,z)logq(z)].

p(zx)=p(x,z)/p(x) 直接整理,得到恒等式

logp(x)=L(q)+DKL(q(z)p(zx)).

KL 散度非负,因此 L(q)logp(x);等号当且仅当 q=p(x) 几乎处处。若 qp(x,z)=0 处放正质量,按扩展实数约定 L(q)=、KL 为 +,不能用有限样本恰未命中该区域来规避支持条件。

同一不等式也可由Jensen 不等式得到。为允许 q 漏掉一部分后验支持,严谨的写法是

logp(x)logEq[p(x,Z)q(Z)]Eq[logp(x,Z)q(Z)].

第一个不等号在 p(x,)q 时取等号;若 q 漏掉正联合质量,把它误写成等号就会漏掉那部分积分。Jensen 证明显示它是下界,KL 分解进一步精确标出缺口。若联合分解为 p(x,z)=p(xz)p(z),还可写成

L(q)=Eq[logp(xZ)]DKL(q(Z)p(Z)),

即拟合观测的期望对数似然减去偏离先验的复杂度项。

变分 Bayesian 推断在分布族 Q 内最大化此量。固定模型下,最大化 ELBO 与最小化 DKL(qp(zx)) 完全等价;跨模型比较时,各模型未知而不同的 KL 缺口不会消失,ELBO 差不是普遍精确的对数 Bayes factor。

直觉

证据把所有潜变量路径的联合质量先相加再取对数;ELBO 则先在 q 下取对数比,再平均。“先对数后平均”因对数凹性更小,差多少恰由 q 与真实后验的反向 KL 衡量。

这项恒等式把不可直接计算的后验归一化常数变成可优化目标,但没有让缺口可观测。ELBO 上升只保证所选 q 在同一模型下缩小 KL,最终绝对误差仍取决于族能否表达后验以及优化是否到达族内最优。

反向 KL 对 q 未覆盖的区域没有直接积分项,所以漏掉一个模态时缺口仍可能有限;但缺失的后验质量会通过已覆盖区域上较小的后验密度进入对数比,缺口不会凭空消失。极限上,只有 q 收敛到完整后验,缺口才趋于零;若 q 在后验零密度处保留正质量,KL 变为 +,ELBO 随即为

例子与边界

固定某个观测 x,设三个潜状态的联合质量为

p(x,a)=0.05,p(x,b)=0.15,p(x,c)=0.30.

证据 p(x)=0.50,后验为 (0.1,0.3,0.6)。取近似 q=(0.2,0.2,0.6),则

L(q)=0.2log0.050.2+0.2log0.150.2+0.6log0.300.60.750683.

logp(x)=log0.50.693147。KL 缺口可逐项算出

0.2log2+0.2log(2/3)+0.6log10.057536,

0.750683+0.057536=0.693147。若改取真实后验,三个联合质量与 q 的比都等于 0.5,ELBO 立即等于 log0.5

支持失败会让下界坠为负无穷:若 p(x,a)=0q(a)>0,对应项含 log0。数值实现把联合密度下溢为零也会出现相同表象,所以必须在 log density 上区分模型结构零与浮点下溢。

漏掉模态则更隐蔽。反向 KL 只在 q 的支持上积分,单峰 q 可完全忽略远处模态而仍给有限 ELBO;其缺口等于未知 KL,无法从一条训练曲线直接读出。使用 Monte Carlo 估计 L 时,样本均值可无偏估计固定 q 的 ELBO,但对 noisy estimate 再取最大值会产生选择偏差;优化后报告同一批训练噪声上的最好值会过于乐观。

推论与应用

ELBO 提供两条不同用途。对固定模型,它是优化 q 的目标;对证据,它只是带未知缺口的下界。若要模型选择,必须评估各模型缺口是否可比,或用更紧的界、重要性估计及独立验证;单凭更大 ELBO 不能区分“证据更大”和“近似族更适合该模型”。

分解式还能指导建模:期望对数似然奖励解释数据,先验 KL 限制近似后验携带的信息。调节这两项的系数会定义新目标,不再是原模型的严格 ELBO,除非相应改变概率模型。实现核验可用有限离散例逐项检查恒等式,再确认 minibatch 缩放、熵符号与 Jacobian 均进入正确一侧。

参考资料
  • David M. Blei, Alp Kucukelbir, and Jon D. McAuliffe, “Variational Inference: A Review for Statisticians,” Journal of the American Statistical Association 112(518), 2017, §2.
  • Christopher M. Bishop, Pattern Recognition and Machine Learning, Springer, 2006, §10.1.
  • Martin J. Wainwright and Michael I. Jordan, “Graphical Models, Exponential Families, and Variational Inference,” Foundations and Trends in Machine Learning 1(1–2), 2008, §§3–5.
关系图谱8 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系