形式陈述
条件标签概率是共同坐标
考虑二分类 Y ∈ { 0 , 1 } ,记
η ( x ) = Pr ( Y = 1 ∣ X = x ) . Bayes 分类器 公理库 Bayes 预测器与 Bayes 风险 Bayes predictor · Bayes classifier · Bayes risk 已知真实联合分布时逐点最小化条件损失所得的最优决策。 为 h ∗ ( x ) = 1 { η ( x ) ≥ 1 / 2 } 。点 x 的难度由
| 2 η ( x ) − 1 | 刻画:它接近 1 时标签方向清楚,接近 0 时两类几乎等可能。对任意分类器 h ,0–1 超额风险满足精确恒等式
R ( h ) − R ( h ∗ ) = E [ | 2 η ( X ) − 1 | 1 { h ( X ) ≠ h ∗ ( X ) } ] . 因此在非常模糊的区域犯错代价小,却也更难从有限样本识别方向;噪声条件规定总体在这一区域能堆积多少质量。
Massart 有界噪声
Massart 条件要求存在 γ > 0 ,使得几乎处处
| 2 η ( X ) − 1 | ≥ γ . 等价地,若以 Bayes 标签为干净标签,条件翻转概率至多
1 − γ 2 < 1 2 . 翻转率可以随 x 改变,只要始终与随机猜测保持统一间隙。它比“每个标签以同一固定概率独立翻转”的经典分类噪声模型 公理库 分类噪声模型 Classification noise model · Random classification noise 类内真概念的标签以固定且独立的小于二分之一概率翻转。 更一般,也比完全不可知模型更有结构。
在该条件下,分类器与 Bayes 规则的分歧概率受超额风险控制:
Pr ( h ( X ) ≠ h ∗ ( X ) ) ≤ R ( h ) − R ( h ∗ ) γ . 这把一阶风险信号和方差联系起来,是局部复杂度产生快速度的入口。
Tsybakov margin/noise 条件
更柔性的 Tsybakov 条件允许存在接近边界的点,但限制其质量。常见参数化为:存在 C > 0 、α ≥ 0 ,对所有 t > 0 ,
Pr ( | 2 η ( X ) − 1 | ≤ t ) ≤ C t α . α 越大,分布在模糊边界附近越稀薄;α = 0 基本不给额外衰减。Massart 条件可视为存在一段完全空的边界邻域,因此比任意有限 α 的幂次控制更强。
文献还常用 Bernstein 指数 β ∈ [ 0 , 1 ] 表述损失方差与均值的关系,或用参数 κ ≥ 1 表述分歧概率。不同参数之间可转换,却方向相反或带分式。引用速率时必须先写出采用的定义,不能只说“满足 Tsybakov 参数 1”。
直觉
一个分布图像
设 X 在实线附近分布,决策边界在 0 ,并令
η ( x ) = 1 2 + c sign ( x ) | x | p 在原点附近成立。若 X 在原点附近密度有界且不为零,则 | 2 η ( X ) − 1 | ≤ t 大致对应 | X | ≲ t 1 / p ,其概率约为 t 1 / p 。因此 Tsybakov 指数由回归函数穿过 1 / 2 的平坦程度和输入在边界附近的质量共同决定,而不是模型参数维数。
若在一个正概率区域上 η ( x ) = 1 / 2 ,那么该区域内任何标签方向都同样好,Pr ( | 2 η − 1 | ≤ t ) 不随 t 消失,无法得到正的 margin 指数。此时 Bayes 分类器在该区域也不唯一。
例子与边界
与其他噪声概念的边界
Massart/Tsybakov 条件描述 P ( Y ∣ X ) 相对 Bayes 决策边界的结构。对抗标签污染允许攻击者按样本整体修改标签,实例依赖噪声可能与采样过程耦合,二者不必满足上述条件。回归中的重尾噪声又关心残差幅度,不能用 | 2 η − 1 | 表示。
代理损失上的 margin condition 也需通过校准函数转回 0–1 风险。逻辑损失或 hinge 损失优化得好,不会无条件继承同一个 Tsybakov 指数;函数类近似误差可能在转换中成为主导项。
推论与应用
对学习速率的作用
一般不可知分类的 uniform deviation 常带来 m − 1 / 2 型超额风险。噪声条件把错误指示的方差与其期望联系起来,配合局部 Rademacher 复杂度 公理库 局部 Rademacher 复杂度 Local Rademacher complexity · 局部化复杂度 围绕低风险或低方差函数逐层收缩函数类,以复杂度不动点刻画快于全局平方根速率的超额风险。 、经验 Bernstein 界或适当代理损失,可得到介于 m − 1 / 2 与 m − 1 之间的速率。具体指数还依赖函数类复杂度、是否 realizable、损失校准和学习器,因此不能从一个噪声参数单独读出通用公式。
快速度是总体分布和条件标签机制的性质,不是“数据清洗得更干净”的同义说法。有限样本无法直接验证几乎处处的 Massart 间隙;若使用代理目标,还必须借分类代理损失与校准 公理库 分类代理损失与校准 classification calibration · classification surrogate loss 说明可优化代理风险在什么条件下能够控制二分类的零一超额风险。 把代理超额风险转回 0–1 风险。实际采用噪声条件,是在建模假设与敏感性分析之间作选择。
参考资料
Pascal Massart and Élodie Nédélec, “Risk Bounds for Statistical Learning,” Annals of Statistics , 2006.
Alexandre Tsybakov, “Optimal Aggregation of Classifiers in Statistical Learning,” Annals of Statistics , 2004.
Peter L. Bartlett, Olivier Bousquet, and Shahar Mendelson, “Local Rademacher Complexities,” Annals of Statistics 33(4), 2005, pp. 1497–1537.