形式陈述
在Bayesian 模型 公理库 Bayesian 统计模型 Bayesian statistical model 以参数先验和条件抽样模型共同定义参数与数据的联合分布,并由观测条件化得到后验。 中,固定观测 x ,设联合密度为 p ( x , z ) ,证据满足
0 < p ( x ) = ∫ p ( x , z ) d z < ∞ . 取任意正规化密度 q ( z ) 。若 q ( z ) > 0 的地方都有 p ( x , z ) > 0 ,且相关对数可积,定义证据下界
L ( q ) = E q [ log p ( x , z ) − log q ( z ) ] . 由 p ( z ∣ x ) = p ( x , z ) / p ( x ) 直接整理,得到恒等式
log p ( x ) = L ( q ) + D KL ( q ( z ) ‖ p ( z ∣ x ) ) . KL 散度 公理库 KL 散度 Kullback–Leibler divergence · Relative entropy 同一可测空间上分布 P 相对于 Q 的对数 Radon–Nikodym 导数在 P 下的积分。 非负,因此 L ( q ) ≤ log p ( x ) ;等号当且仅当 q = p ( ⋅ ∣ x ) 几乎处处。若 q 在 p ( x , z ) = 0 处放正质量,按扩展实数约定 L ( q ) = − ∞ 、KL 为 + ∞ ,不能用有限样本恰未命中该区域来规避支持条件。
同一不等式也可由Jensen 不等式 公理库 Jensen 不等式 Jensen's inequality 凸函数作用于平均值不超过函数值的相同加权平均。 得到。为允许 q 漏掉一部分后验支持,严谨的写法是
log p ( x ) ≥ log E q [ p ( x , Z ) q ( Z ) ] ≥ E q [ log p ( x , Z ) q ( Z ) ] . 第一个不等号在 p ( x , ⋅ ) ≪ q 时取等号;若 q 漏掉正联合质量,把它误写成等号就会漏掉那部分积分。Jensen 证明显示它是下界,KL 分解进一步精确标出缺口。若联合分解为 p ( x , z ) = p ( x ∣ z ) p ( z ) ,还可写成
L ( q ) = E q [ log p ( x ∣ Z ) ] − D KL ( q ( Z ) ‖ p ( Z ) ) , 即拟合观测的期望对数似然减去偏离先验的复杂度项。
变分 Bayesian 推断 公理库 变分 Bayesian 推断 Variational Bayesian inference · Variational inference · VI 在可计算分布族内优化与真实后验的散度,以确定性或随机优化换取受限族中的快速后验近似。 在分布族 Q 内最大化此量。固定模型下,最大化 ELBO 与最小化 D KL ( q ‖ p ( z ∣ x ) ) 完全等价;跨模型比较时,各模型未知而不同的 KL 缺口不会消失,ELBO 差不是普遍精确的对数 Bayes factor。
直觉
证据把所有潜变量路径的联合质量先相加再取对数;ELBO 则先在 q 下取对数比,再平均。“先对数后平均”因对数凹性更小,差多少恰由 q 与真实后验的反向 KL 衡量。
这项恒等式把不可直接计算的后验归一化常数变成可优化目标,但没有让缺口可观测。ELBO 上升只保证所选 q 在同一模型下缩小 KL,最终绝对误差仍取决于族能否表达后验以及优化是否到达族内最优。
反向 KL 对 q 未覆盖的区域没有直接积分项,所以漏掉一个模态时缺口仍可能有限;但缺失的后验质量会通过已覆盖区域上较小的后验密度进入对数比,缺口不会凭空消失。极限上,只有 q 收敛到完整后验,缺口才趋于零;若 q 在后验零密度处保留正质量,KL 变为 + ∞ ,ELBO 随即为 − ∞ 。
例子与边界
固定某个观测 x ,设三个潜状态的联合质量为
p ( x , a ) = 0.05 , p ( x , b ) = 0.15 , p ( x , c ) = 0.30 . 证据 p ( x ) = 0.50 ,后验为 ( 0.1 , 0.3 , 0.6 ) 。取近似 q = ( 0.2 , 0.2 , 0.6 ) ,则
L ( q ) = 0.2 log 0.05 0.2 + 0.2 log 0.15 0.2 + 0.6 log 0.30 0.6 ≈ − 0.750683 . 而 log p ( x ) = log 0.5 ≈ − 0.693147 。KL 缺口可逐项算出
0.2 log 2 + 0.2 log ( 2 / 3 ) + 0.6 log 1 ≈ 0.057536 , 且 − 0.750683 + 0.057536 = − 0.693147 。若改取真实后验,三个联合质量与 q 的比都等于 0.5 ,ELBO 立即等于 log 0.5 。
支持失败会让下界坠为负无穷:若 p ( x , a ) = 0 而 q ( a ) > 0 ,对应项含 log 0 。数值实现把联合密度下溢为零也会出现相同表象,所以必须在 log density 上区分模型结构零与浮点下溢。
漏掉模态则更隐蔽。反向 KL 只在 q 的支持上积分,单峰 q 可完全忽略远处模态而仍给有限 ELBO;其缺口等于未知 KL,无法从一条训练曲线直接读出。使用 Monte Carlo 估计 L 时,样本均值可无偏估计固定 q 的 ELBO,但对 noisy estimate 再取最大值会产生选择偏差;优化后报告同一批训练噪声上的最好值会过于乐观。
推论与应用
ELBO 提供两条不同用途。对固定模型,它是优化 q 的目标;对证据,它只是带未知缺口的下界。若要模型选择,必须评估各模型缺口是否可比,或用更紧的界、重要性估计及独立验证;单凭更大 ELBO 不能区分“证据更大”和“近似族更适合该模型”。
分解式还能指导建模:期望对数似然奖励解释数据,先验 KL 限制近似后验携带的信息。调节这两项的系数会定义新目标,不再是原模型的严格 ELBO,除非相应改变概率模型。实现核验可用有限离散例逐项检查恒等式,再确认 minibatch 缩放、熵符号与 Jacobian 均进入正确一侧。
参考资料
David M. Blei, Alp Kucukelbir, and Jon D. McAuliffe, “Variational Inference: A Review for Statisticians,” Journal of the American Statistical Association 112(518), 2017, §2.
Christopher M. Bishop, Pattern Recognition and Machine Learning , Springer, 2006, §10.1.
Martin J. Wainwright and Michael I. Jordan, “Graphical Models, Exponential Families, and Variational Inference,” Foundations and Trends in Machine Learning 1(1–2), 2008, §§3–5.