Skip to content

Bayes 预测器与 Bayes 风险

Bayes predictor · Bayes classifier · Bayes risk

已知真实联合分布时逐点最小化条件损失所得的最优决策。

条件最优决策

给定 (X,Y)D,动作 aX=x 处的条件风险为 r(ax)=E[(a,Y)X=x]。Bayes 预测器逐点选择

h(x)argminar(ax),

Bayes 风险则是 R=infhRD(h)。逐点不等式经全期望积分,便说明 h 整体最优。若最小值不达到或选择不可测,应保留下确界与可测选择条件。

二分类令 η(x)=Pr(Y=1X=x)。0–1 损失下预测 1 与 0 的条件错误分别为 1η(x)η(x),故阈值为 1/2。平方损失可分解为条件方差加 (aE[YX])2,所以条件均值最优;绝对损失则由条件中位数最优。

不可约错误与消歧

若同一 x 的标签以 0.8/0.2 随机出现,任何分类器至少承担 0.2 条件错误。正 Bayes 风险不是样本少或优化失败,而是观察 X 后仍不可消除的不确定性。

Bayes classifier 不要求给参数设置先验,也不等同于 Bayesian inference。Bayes 定理可帮助计算条件概率;“Bayes 最优”说的是相对真实分布与损失的最优行动。有限样本学习器只能尝试估计它。

以两个特征值为例:Pr(X=a)=Pr(X=b)=1/2Pr(Y=1a)=0.9Pr(Y=1b)=0.4。0–1 Bayes 分类器在 a 预测 1、在 b 预测 0,风险为

R=12(0.1)+12(0.4)=0.25.

始终预测多数类 1 的风险则为 Pr(Y=0)=0.35。这个算例既说明特征条件化能降低风险,也说明 Bayes 风险不必为零。

多类并列和连续动作暴露定义边界。若两个标签条件概率同为最大,任取其一都有相同条件风险,但学习器必须固定可测的 tie-breaking;平方损失下若 E[Y2X] 不存在,条件均值公式也不足以保证有限风险。Bayes 规则是损失与分布共同决定的,不是一条脱离可积性条件的万能公式。

Bayes 风险还可写成条件最优风险的期望:

R=EX[infaE((a,Y)X)],

前提是允许足够丰富的可测决策规则。若只在假设类 H 中优化,得到的是 RH,通常大于 R;把二者相减才是逼近误差。

给参数设置先验后得到的“Bayes estimator”则最小化后验平均损失,所平均的是参数不确定性。它与本页给定真实联合分布后的 Bayes predictor 名称相近、优化对象不同,引用时应明确是预测决策还是参数决策。

参考资料
  • James Berger, Statistical Decision Theory and Bayesian Analysis, 1985.
  • Devroye, Györfi, Lugosi, A Probabilistic Theory of Pattern Recognition, 1996.