“变分 Bayesian 推断在分布族 $\mathcal Q$ 内最大化此量。固定模型下,最大化 ELBO 与最小化 $D {\mathrm{KL}}(q p(z\mid x))$ 完全等价…”
形式陈述 ​
给定观测
变分推断把后验计算改写为
这里的KL 散度方向固定为
并有
常见 mean-field 族写成
前提是右侧可积并能正规化。若期望不可解析,可用 score-function 或重参数化梯度做随机优化;这时 minibatch、Monte Carlo 梯度和步长引入优化噪声,但不会改变受限族本身的近似上限。VI 有时形成凸优化问题,例如对某些分布空间或单坐标子问题;一般神经变分族的参数目标并不凸,局部最优和初始化敏感不能当作实现瑕疵略去。
算法输出
直觉
VI 用一族容易存储和计算的分布去覆盖复杂后验,再把拟合变成优化。反向 KL 对
速度来自压缩:不保存漫长轨迹,只保存
例子与边界
取三点后验
这个族被迫给
所以
若
对相隔很远的等权双正态混合,用单个正态
随机梯度引入另一层边界:用很少样本估计 ELBO 梯度可能方差巨大,优化未收敛与族失配需要分开诊断。即便训练 ELBO 稳定,若用同一随机估计比较非常接近的模型证据,也不能把下界差直接当作精确 Bayes factor。
推论与应用
VI 适合需要快速重复拟合、在线预测或把后验近似嵌入更大优化流程的场景,前提是关注的函数对族失配不敏感。选择族时应从必须保留的依赖和尾部倒推:mean-field 成本低但切断相关,低秩协方差保留部分线性结构,流模型提高表达力却增加优化与 Jacobian 成本。
验证链条应同时比较优化误差和近似误差。多初值揭示局部最优;更丰富的族检验结构偏差;在可行子模型上与 MCMC 或精确枚举比较校准均值、方差和尾部。只有 ELBO 不能定位误差来自哪一层。若结果进入决策,应针对损失函数直接检查
参考资料
- David M. Blei, Alp Kucukelbir, and Jon D. McAuliffe, “Variational Inference: A Review for Statisticians,” Journal of the American Statistical Association 112(518), 2017, pp. 859–877.
- Michael I. Jordan et al., “An Introduction to Variational Methods for Graphical Models,” Machine Learning 37, 1999, pp. 183–233.
- Martin J. Wainwright and Michael I. Jordan, “Graphical Models, Exponential Families, and Variational Inference,” Foundations and Trends in Machine Learning 1(1–2), 2008, pp. 1–305, §§3–5.