Skip to content

Bayes 估计量与后验风险

Bayes estimator · Posterior expected loss

给定观测后最小化后验期望损失的行动规则及其条件风险。

形式陈述

Bayesian 模型中,观测 X=x 后参数后验为 Π(dθx)。对行动 aA 与损失 L(θ,a),后验风险定义为

ρ(ax)=ΘL(θ,a)Π(dθx),

只要积分有定义。Bayes 行动是

δB(x)argminaAρ(ax).

若可测选择存在,则 xδB(x) 是 Bayes 规则。全局 Bayes 风险满足迭代期望

r(Π,δ)=E[L(Θ,δ(X))]=EX[ρ(δ(X)X)].

逐个 x 最小化后验风险因此也最小化先验—抽样联合分布下的 Bayes 风险,前提是可测性与可积性允许交换。

三种典型损失

实值参数、平方损失 L(θ,a)=(aθ)2 下,若后验二阶矩有限,

ρ(ax)=Var(Θx)+(aE[Θx])2,

故唯一 Bayes 行动为后验均值。

绝对损失 |aθ| 下,任何后验中位数都是 Bayes 行动;若后验中位数区间不唯一,Bayes 行动也不唯一。对离散行动和 01 损失,选择后验概率最大的状态,即 MAP 行动。

这些结论由损失决定。后验均值、后验中位数和 MAP 不是三个可以随意互换的“Bayesian 点估计”。

例子与计算

Bernoulli 样本配 Beta(a,b) 先验,观察 s 次成功、ns 次失败后,

θxBeta(a+s,b+ns).

平方损失下 Bayes 估计为

δB(x)=a+sa+b+n.

它可写为

a+ba+b+naa+b+na+b+nsn,

即先验均值与样本比例的加权平均。取 a=b=1,n=8,s=6,结果为 7/10,而样本比例为 3/4

若目标行动是预测下一次 01 且错判损失相同,则后验预测成功概率超过 1/2 时选 1。这与估计连续参数的平方损失问题不同。

若低估损失权重为 c>0、高估权重为 c+>0,损失写成

L(θ,a)=c(θa)++c+(aθ)+.

最小化后验风险得到分位数 q=c/(c+c+)。当漏报代价更高时 q 上移,行动更保守地覆盖大参数;这是损失改变最优规则的可追踪机制,不需要修改后验本身。

边界与失败情形

Bayes 规则不总是 MAP。连续参数下“精确猜中”的 01 损失几乎处处为一,不能简单用密度众数解释;MAP 常对应小邻域损失的极限,并且受参数化影响。

后验风险是给定模型和当前数据的条件期望,不等于频率学点风险 R(θ,δ)。Bayes 规则平均意义好,不保证对每个固定 θ 都优于其他规则。

若后验均值不存在,平方损失风险可能处处无穷;若行动空间非闭或损失不下半连续,风险下确界可能不被达到。写出 argmin 前要确认解存在。

不当先验若后验虽 proper,某些损失下的后验矩仍可能发散。代数上得到后验核不保证每种 Bayes 行动可定义。

若行动受约束,如 a0,平方损失 Bayes 行动是后验均值在闭凸行动集上的投影,而非无约束均值。非凸行动空间可能产生多个全局极小点,数值优化返回其中一个时要保留其决策等价性。

推论与应用

后验风险还能比较行动的不确定代价,而不只输出点估计。非对称损失把高估和低估赋予不同权重,Bayes 行动变为相应后验分位数。

在适当条件下,Bayes 规则可为 admissible;某些 least favorable prior 的 Bayes 规则还是 minimax。但这些结论需要全参数风险分析,不能从“使用了先验”直接推出。

若两个行动具有相同最小后验风险,任何可测的并列选择都是 Bayes 行动,随机混合在损失对行动线性时也保持最优。唯一性需要严格凸损失与非退化后验等条件;软件固定返回第一个极小点只是选择规则,不是统计上的唯一答案。

多分类行动可用损失矩阵 Cij 表示真实状态 i 却选择 j 的代价。给定后验概率 qi(x),行动 j 的风险是 iCijqi(x),逐列计算后取最小者。只有所有错分代价相同且正确代价为零时,这才退化为选择最大后验概率类别。

参考资料
  • James O. Berger, Statistical Decision Theory and Bayesian Analysis, 2nd ed., Springer, 1985,Ch. 4。
  • Christian P. Robert, The Bayesian Choice, 2nd ed., Springer, 2007,Ch. 2。
  • Andrew Gelman et al., Bayesian Data Analysis, 3rd ed., CRC Press, 2013,Ch. 2。