Skip to content

Bayes 预测器与 Bayes 风险

Bayes predictor · Bayes classifier · Bayes risk

已知真实联合分布时逐点最小化条件损失所得的最优决策。

条目类型
定义

形式陈述

给定 (X,Y)D损失函数条件分布 YX=x 决定动作 a条件期望损失 r(ax)=E[(a,Y)X=x]。Bayes 预测器逐点选择

h(x)argminar(ax),

Bayes 风险则是 R=infhRD(h)。逐点不等式经全期望积分,便说明 h 整体最优。若最小值不达到或选择不可测,应保留下确界与可测选择条件。

二分类令 η(x)=Pr(Y=1X=x)。0–1 损失下预测 1 与 0 的条件错误分别为 1η(x)η(x),故阈值为 1/2。平方损失可分解为条件方差加 (aE[YX])2,所以条件均值最优;绝对损失则由条件中位数最优。

直觉

若同一 x 的标签以 0.8/0.2 随机出现,任何分类器至少承担 0.2 条件错误。正 Bayes 风险不是样本少或优化失败,而是观察 X 后仍不可消除的不确定性。

Bayes classifier 不要求给参数设置先验,也不等同于 Bayesian inference。Bayes 定理可帮助计算条件概率;“Bayes 最优”说的是相对真实分布与损失的最优行动。有限样本学习器只能尝试估计它。

例子与边界

以两个特征值为例:Pr(X=a)=Pr(X=b)=1/2Pr(Y=1a)=0.9Pr(Y=1b)=0.4。0–1 Bayes 分类器在 a 预测 1、在 b 预测 0,风险为

R=12(0.1)+12(0.4)=0.25.

始终预测多数类 1 的风险则为 Pr(Y=0)=0.35。这个算例既说明特征条件化能降低风险,也说明 Bayes 风险不必为零。

多类并列和连续动作暴露定义边界。若两个标签条件概率同为最大,任取其一都有相同条件风险,但学习器必须固定可测的 tie-breaking;平方损失下若 E[Y2X] 不存在,条件均值公式也不足以保证有限风险。Bayes 规则是损失与分布共同决定的,不是一条脱离可积性条件的万能公式。

推论与应用

Bayes 风险还可写成条件最优风险的期望:

R=EX[infaE((a,Y)X)],

前提是允许足够丰富的可测决策规则。若只在假设类 H 中优化,得到的是 RH,通常大于 R;把二者相减才是逼近误差。

给参数设置先验后得到的“Bayes estimator”则最小化后验平均损失,所平均的是参数不确定性。它与本页给定真实联合分布后的 Bayes predictor 名称相近、优化对象不同,引用时应明确是预测决策还是参数决策。

分类校准把代理损失的类内最优与 0–1 Bayes 决策连接起来;超额风险分解则把类内最优 RH 与 Bayes 风险 R 的差解释为逼近误差。回归平方损失中,条件均值正是 Bayes 预测器,并产生噪声方差与估计误差的精确正交分解。

参考资料
  • James Berger, Statistical Decision Theory and Bayesian Analysis, 1985.
  • Devroye, Györfi, Lugosi, A Probabilistic Theory of Pattern Recognition, 1996.
关系图谱20 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组