Skip to content

PAC-Bayes 框架

PAC-Bayesian framework · PAC-Bayes

以数据无关先验和数据依赖后验之间的 KL,控制随机化 Gibbs 预测器的风险。

条目类型
模型

形式陈述

先验、后验与假设空间

PAC-Bayes 不直接给单个参数贴“贝叶斯”标签,而是在假设空间上比较两份概率分布:训练前固定的先验 P,以及看过样本后选择的后验 QS。后验若远离先验,就为这种数据驱动的集中付出KL 散度 KL(QSP);若经验风险低且移动代价不大,便可得到总体风险保证。

Gibbs 风险

每次预测先抽取 hQ 再用 h 预测,这定义 Gibbs predictor。其总体和经验风险分别为

RD(Q)=EhQRD(h),R^S(Q)=EhQR^S(h).

这里的 RD(h)R^S(h) 分别来自损失函数定义的总体风险与经验风险。Gibbs 风险不同于参数均值 h¯=EQh 的风险,也不同于多数投票的风险;只有在线性或凸性等额外条件下才能比较。

一类规范界

[0,1] 损失,许多 PAC-Bayes 定理具有如下结构:训练前固定且独立于 SP,则以概率至少 1δ,对所有后验 Q 同时有

kl(R^S(Q)RD(Q))KL(QP)+log(Cm/δ)m,

其中左侧是 Bernoulli 参数之间的二元 KL,Cm 的具体形式随定理版本而变。证明通常对固定 h 的指数矩取先验平均,再用 change-of-measure 不等式把 P 换成任意 Q,最后用 Markov 界形成对所有 Q 的共同事件。

直觉

先验可以看作训练前分配给各类解释的编码预算,后验则是数据出现后真正想使用的随机化预测器。若后验集中到先验原本认为极不可能的区域,它需要更多信息才能被数据“指定”,于是 KL 项变大;若它主要重排先验已经覆盖的合理假设,复杂度代价就较小。

共同高概率事件是框架的关键。证明先在与数据无关的 P 下控制平均指数矩,再用 change of measure 把任意数据依赖 Q 的期望搬回 P;KL 正是这次搬运的价格。因为事件对所有 Q 同时成立,看到数据后才能在经验风险与 KL 之间优化,而不需要再为后验选择做一次并集界。

例子与边界

有限类恢复 Occam 复杂度

H 有限且 P 均匀,取点质量后验 Q=δh,则

KL(δhP)=log|H|.

这恢复有限类的 Occam/编码复杂度。若 Q 把质量分散在许多先验已经认为合理的假设上,KL 还会利用局部结构,而不是只看全类大小。

先验依赖与预测器辨析

标准先验必须在观察训练样本前确定。用同一数据调出先验再直接代入会破坏证明;可采用独立数据划分或专门的数据依赖先验定理。Q 可以只是为获得风险界而设计的随机化预测器,不必解释成主观参数不确定性;反之,普通贝叶斯后验也不会自动满足某个 PAC-Bayes 界。KL 为无穷时界仍形式正确但没有信息,这要求 QP 绝对连续。

推论与应用

把规范不等式对总体风险反解,就得到可直接计算的PAC-Bayes 泛化界。经验风险推动后验靠近训练表现好的假设,KL 项阻止它无代价地集中到先验几乎不支持的区域;二者合起来形成一种由定理本身给出的正则化目标。

有限类上,点质量后验恢复 log|H| 复杂度;连续参数模型中,选择带非零方差的后验可以保持对先验的绝对连续,并让界利用参数附近一整片低损失区域。神经网络中的 PAC-Bayes 分析常据此研究权重扰动后的 Gibbs 风险,而不是只给一个确定权重向量套公式。

框架也适合比较不同先验知识或压缩方案,但先验必须与训练样本保持定理要求的独立性。若要用数据选择先验,应使用独立样本、分层先验或专门的数据依赖先验界,并把新增的信息代价明确写入结论。

参考资料
关系图谱11 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组