Skip to content

Bayesian 统计模型

Bayesian statistical model

以参数先验和条件抽样模型共同定义参数与数据的联合分布,并由观测条件化得到后验。

形式陈述

Bayesian 统计模型在参数空间 (Θ,G) 上指定先验概率分布 Π,并对每个 θΘ 指定样本的条件分布 Pθ。两者定义联合分布

P(dθ,dx)=Π(dθ)Pθ(dx).

数据的边缘分布或先验预测分布为

m(dx)=ΘPθ(dx)Π(dθ).

给定观测 X=x,参数的条件分布 Π(dθx) 称为后验分布。

Pθ 对测度 μ 有密度 pθ(x),先验对测度 ν 有密度 π(θ),且

0<m(x)=Θpϑ(x)π(ϑ)dν(ϑ)<,

Bayes 公式给出

π(θx)=pθ(x)π(θ)m(x).

常写作 π(θx)L(θ;x)π(θ),但比例式只在归一化常数有限且非零时代表概率分布。对独立样本,似然是 ipθ(xi);后验依赖完整观测,却可在模型有充分统计量时只通过该统计量更新。

未来观测 Xnew 的后验预测分布为

P(XnewAx)=ΘPθ(A)Π(dθx),

它同时平均参数不确定性与给定参数后的抽样随机性。

直觉

先验描述看到当前数据以前模型对参数的概率判断,似然描述各参数生成当前数据的相对能力,后验则是联合模型在已观测事件上的条件化。参数是否被赋予随机性是建模选择,不是所有频率学参数自动具有的属性。

更新是一条状态轨迹:先验 Π 与实验核 Pθ 生成数据边缘律;观测到 x 后,联合质量沿参数方向重新归一化为后验;预测下一次观测时,再把后验通过同一抽样核推向数据空间。三个分布作用在不同空间,不能只因都带概率符号就互换。

例子与计算

X1,,Xnθ 独立 Bernoulli(θ),并取先验

θBeta(a,b),a,b>0.

若观察到 s=iXi 次成功,则

π(θx)θs(1θ)nsθa1(1θ)b1,

所以

θxBeta(a+s,b+ns).

取均匀先验 a=b=1,观察 n=10,s=7 后,后验为 Beta(8,4),后验均值为 8/12=2/3。它不同于最大似然估计 7/10,因为先验相当于加入一个成功和一个失败的平滑信息。

下一次成功的后验预测概率为

P(X11=1x)=E[θx]=a+sa+b+n.

这里先对未知成功率取后验平均,再生成未来 Bernoulli 结果;不是把后验均值误当成已知真参数的声明。

边界与失败情形

似然不是后验。没有先验和归一化,L(θ;x) 不要求对参数积分为一;两个分析者使用同一似然但不同先验,可以得到不同后验。反过来,同一个后验表达也必须说明参数化,因为先验密度在非线性变换下带 Jacobian。

不当先验如 π(θ)1 在无界空间上可能没有总质量一。它有时与似然结合后产生 proper 后验,但这必须逐模型验证;若 m(x)=,所谓后验根本无法归一化。使用 improper prior 时也不能把普通边缘似然直接用于 Bayes factor,因为任意比例常数不会消失。

先验支持集会限制后验:若先验给某区域概率零,无论有限数据的似然多大,后验仍为零。所谓“数据会淹没先验”需要真参数处于支持内、模型可识别和适当渐近正则性,并非有限样本恒等式。

后验概率只在联合模型成立时校准。严重模型失配、选择性报告或未建模的停止机制会使后验回答错误问题;posterior predictive check 用于发现某些失配,但不能证明模型为真。

推论与应用

给定损失函数,Bayes 行动最小化后验期望损失:平方损失下是后验均值,绝对损失下是后验中位数,区间估计则由后验分位数或最高密度区域构造。这些是联合模型内部的条件决策,不自动拥有频率学覆盖率。

层级模型通过超参数连接多组参数,使组间共享信息;计算上可用解析共轭、数值积分、MCMC 或变分近似。近似算法还要另外检查收敛与误差,不能把目标后验的定义和求解它的算法混成一件事。

参考资料
  • James O. Berger, Statistical Decision Theory and Bayesian Analysis, 2nd ed., Springer, 1985,Ch. 4。
  • Andrew Gelman et al., Bayesian Data Analysis, 3rd ed., CRC Press, 2013,Ch. 1–3。
  • Christian P. Robert, The Bayesian Choice, 2nd ed., Springer, 2007,Ch. 1–3。