Skip to content

定义Definition

Bayesian 统计模型

Bayesian statistical model

以参数先验和条件抽样模型共同定义参数与数据的联合分布,并由观测条件化得到后验。

形式陈述 ​

Bayesian 统计模型把一个统计模型放进联合概率框架:在参数空间 (Θ,G) 上指定先验概率分布 Π,并对每个 θ∈Θ 指定样本的条件分布 Pθ。这里 θ↦Pθ(A) 对每个可测事件 A 应可测,才能作为条件概率核积分。两者定义联合分布

P(dθ,dx)=Π(dθ)Pθ(dx).

数据的边缘分布或先验预测分布为

m(dx)=∫ΘPθ(dx)Π(dθ).

给定观测 X=x,参数的条件分布 Π(dθ∣x) 称为后验分布。

下文默认参数与数据空间为标准 Borel 空间,从而可取正则条件分布作为后验概率核;它在数据边缘律 m 的几乎处处意义下确定。在一般可测空间上,必须另证这种核存在,不能仅凭已经构造联合分布就断言每个 x 都有后验分布。

若选定共同的 σ-有限数据参考测度 μ,并为各 Pθ 选取相对于 μ 的密度,使 (θ,x)↦pθ(x) 联合可测;同时,先验相对于 σ-有限参考测度 ν 有密度 π(θ),且

0<m(x)=∫Θpϑ(x)π(ϑ)dν(ϑ)<∞,

则Bayes 公式给出

π(θ∣x)=pθ(x)π(θ)m(x).

常写作 π(θ∣x)∝L(θ;x)π(θ),但比例式只在归一化常数有限且非零时代表概率分布。对给定 θ 后独立且条件同分布的样本,似然是 ∏ipθ(xi);后验依赖完整观测,却可在模型有充分统计量时只通过该统计量更新。

若给定 θ 后,未来观测 Xnew 与当前数据条件独立,且仍服从 Pθ,其后验预测分布为

P(Xnew∈A∣x)=∫ΘPθ(A)Π(dθ∣x),

它同时平均参数不确定性与给定参数后的抽样随机性。若未来与历史在给定参数后仍有关联,例如自回归序列,应在积分中改用 Pθ(Xnew∈A∣x)。

这里增加的是先验与条件化结构,而不是从原来的可观测分布族中选出一个子族。普通统计模型提供条件抽样规律,Bayesian 模型再规定参数与数据之间的联合概率结构;两者承担的定义任务不同。

直觉

先验描述看到当前数据以前模型对参数的概率判断,似然描述各参数生成当前数据的相对能力,后验则是联合模型在已观测事件上的条件化。参数是否被赋予随机性是建模选择,不是所有频率学参数自动具有的属性。

更新是一条状态轨迹:先验 Π 与实验核 Pθ 生成数据边缘律;观测到 x 后,联合质量沿参数方向重新归一化为后验;预测下一次观测时,再把后验通过同一抽样核推向数据空间。三个分布作用在不同空间,不能只因都带概率符号就互换。

例子与边界

设 X1,…,Xn∣θ 独立 Bernoulli(θ),并取先验

θ∼Beta(a,b),a,b>0.

若观察到 s=∑iXi 次成功,则

π(θ∣x)∝θs(1−θ)n−sθa−1(1−θ)b−1,

所以

θ∣x∼Beta(a+s,b+n−s).

取均匀先验 a=b=1,观察 n=10,s=7 后,后验为 Beta(8,4),后验均值为 8/12=2/3。它不同于最大似然估计 7/10,因为先验相当于加入一个成功和一个失败的平滑信息。

下一次成功的后验预测概率为

P(X11=1∣x)=E[θ∣x]=a+sa+b+n.

这里先对未知成功率取后验平均,再生成未来 Bernoulli 结果。一次预测恰好可用后验均值表示,却不能把所有未来数据都当成独立 Bernoulli(2/3)。例如连续两次成功的预测概率为

E(θ2∣x)=8⋅912⋅13=613,

大于 (2/3)2=4/9。两个未来结果共享同一个未知 θ,积分掉参数后产生正相关;逐次独立抽一个新的参数会改变预测模型。

固定同一个参数后生成无限 IID Bernoulli 序列,再对参数积分,所得序列是可交换的。反过来,Bernoulli 情形的 de Finetti 定理保证每个无限可交换序列都有唯一的这类混合表示,但混合测度不必是 Beta 分布。有限向量仅有置换对称性,甚至再加正协方差,仍不足以保证这种无限延拓。

边界与失败情形 ​

似然不是后验。没有先验和归一化,L(θ;x) 不要求对参数积分为一;两个分析者使用同一似然但不同先验,可以得到不同后验。反过来,同一个后验表达也必须说明参数化,因为先验密度在非线性变换下带 Jacobian。

不当先验如 π(θ)∝1 在无界空间上可能没有总质量一。它有时与似然结合后产生 proper 后验,但这必须逐模型验证;若 m(x)=∞,所谓后验根本无法归一化。使用 improper prior 时也不能把普通边缘似然直接用于 Bayes factor,因为任意比例常数不会消失。

先验支持集会限制后验:若先验给某区域概率零,无论有限数据的似然多大,后验仍为零。所谓“数据会淹没先验”需要真参数处于支持内、模型可识别和适当渐近正则性,并非有限样本恒等式。

后验概率只在联合模型成立时校准。严重模型失配或未纳入的选择性报告会使后验回答错误问题。停止机制是否可忽略要看其是否额外携带参数信息;若给定已观察轨迹后停止规则的因子不含参数,它会在后验归一化时消去,不能笼统说所有可选停止都会破坏后验。信息性选择或停止机制则需要进入观测模型;posterior predictive check 用于发现某些失配,但不能证明模型为真。

推论与应用

给定损失函数,Bayes 行动最小化后验期望损失。对实值参数和不受约束的实值行动,后验二阶矩有限时,平方损失选择后验均值;后验一阶绝对矩有限时,绝对损失选择后验中位数。后验能归一化并不保证这些矩有限,重尾情形必须单独检查。

区间估计可由后验分位数或最高密度区域构造,回答的是当前联合模型下参数落入区域的概率。它与反复抽样下的频率学覆盖率使用不同概率口径,后者还需要另外证明。

层级模型通过超参数连接多组参数,使组间共享信息;计算上可用解析共轭、数值积分、MCMC 或变分近似。近似算法还要另外检查收敛与误差,不能把目标后验的定义和求解它的算法混成一件事。

在固定维、可识别且局部正则的模型中,Bernstein–von Mises 定理说明后验在 1/n 尺度上何时接近信息正态分布;边界、高维、非参数或错设模型不由这条有限维结论自动覆盖。

参考资料
  • James O. Berger, Statistical Decision Theory and Bayesian Analysis, 2nd ed., Springer, 1985,Ch. 4。

  • Andrew Gelman et al., Bayesian Data Analysis, 3rd ed., CRC Press, 2013,Ch. 1–3。

  • Christian P. Robert, The Bayesian Choice, 2nd ed., Springer, 2007,Ch. 1–3。

  • Larry Wasserman, All of Statistics: A Concise Course in Statistical Inference, Springer, 2004,§11.2:先验、后验与 Beta–Bernoulli 更新,CMU 教材全文。

关系图谱17 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

使用的工具