形式陈述
先验、后验与假设空间
PAC-Bayes 不直接给单个参数贴“贝叶斯”标签,而是在假设空间公理库预测器与假设类Predictor · Hypothesis class区分可用于预测的函数、函数集合及其参数表示。上比较两份概率分布公理库概率分布Probability distribution · Law可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。:训练前固定的先验 ,以及看过样本后选择的后验 。后验若远离先验,就为这种数据驱动的集中付出KL 散度公理库KL 散度Kullback–Leibler divergence · Relative entropy同一可测空间上分布 P 相对于 Q 的对数 Radon–Nikodym 导数在 P 下的积分。 ;若经验风险低且移动代价不大,便可得到总体风险保证。
Gibbs 风险
每次预测先抽取 再用 预测,这定义 Gibbs predictor。其总体和经验风险分别为
这里的 与 分别来自损失函数定义的总体风险与经验风险公理库损失函数与总体风险Loss function · Population risk · Expected risk损失刻画一次决策的代价,总体风险是未知分布下的平均代价。。Gibbs 风险不同于参数均值 的风险,也不同于多数投票的风险;只有在线性或凸性等额外条件下才能比较。
一类规范界
对 损失,许多 PAC-Bayes 定理具有如下结构:训练前固定且独立于 的 ,则以概率至少 ,对所有后验 同时有
其中左侧是 Bernoulli 参数之间的二元 KL, 的具体形式随定理版本而变。证明通常对固定 的指数矩取先验平均,再用 change-of-measure 不等式把 换成任意 ,最后用 Markov 界形成对所有 的共同事件。
直觉
先验可以看作训练前分配给各类解释的编码预算,后验则是数据出现后真正想使用的随机化预测器。若后验集中到先验原本认为极不可能的区域,它需要更多信息才能被数据“指定”,于是 KL 项变大;若它主要重排先验已经覆盖的合理假设,复杂度代价就较小。
共同高概率事件是框架的关键。证明先在与数据无关的 下控制平均指数矩,再用 change of measure 把任意数据依赖 的期望搬回 ;KL 正是这次搬运的价格。因为事件对所有 同时成立,看到数据后才能在经验风险与 KL 之间优化,而不需要再为后验选择做一次并集界。
例子与边界
有限类恢复 Occam 复杂度
若 有限且 均匀,取点质量后验 ,则
这恢复有限类的 Occam/编码复杂度。若 把质量分散在许多先验已经认为合理的假设上,KL 还会利用局部结构,而不是只看全类大小。
先验依赖与预测器辨析
标准先验必须在观察训练样本前确定。用同一数据调出先验再直接代入会破坏证明;可采用独立数据划分或专门的数据依赖先验定理。 可以只是为获得风险界而设计的随机化预测器,不必解释成主观参数不确定性;反之,普通贝叶斯后验公理库Bayes 定理Bayes' theorem · Bayes' rule用先验与证据在各假设下的可能性反转条件方向,得到归一化后验。也不会自动满足某个 PAC-Bayes 界。KL 为无穷时界仍形式正确但没有信息,这要求 对 绝对连续。
推论与应用
把规范不等式对总体风险反解,就得到可直接计算的PAC-Bayes 泛化界公理库PAC-Bayes 泛化界PAC-Bayes bound · PAC-Bayes proof template以先验到数据依赖后验的 KL 散度支付换测度代价,将先验下的指数矩控制转成同时覆盖所有 Gibbs 后验的泛化证书。。经验风险推动后验靠近训练表现好的假设,KL 项阻止它无代价地集中到先验几乎不支持的区域;二者合起来形成一种由定理本身给出的正则化目标。
有限类上,点质量后验恢复 复杂度;连续参数模型中,选择带非零方差的后验可以保持对先验的绝对连续,并让界利用参数附近一整片低损失区域。神经网络中的 PAC-Bayes 分析常据此研究权重扰动后的 Gibbs 风险,而不是只给一个确定权重向量套公式。
框架也适合比较不同先验知识或压缩方案,但先验必须与训练样本保持定理要求的独立性。若要用数据选择先验,应使用独立样本、分层先验或专门的数据依赖先验界,并把新增的信息代价明确写入结论。
参考资料