Skip to content

分类噪声模型

Classification noise model · Random classification noise

类内真概念的标签以固定且独立的小于二分之一概率翻转。

条目类型
模型

形式陈述

可实现分类中的类内真概念 c 出发,先取 XDX 与干净标签 c(X);再取独立的Bernoulli 随机变量

NBernoulli(η),0η<1/2,

观测 Y=c(X)Nη 可未知,但必须固定且噪声与 X、其他样本独立。

在二元编码下,

Pr(Yh(X))=η+(12η)Pr(c(X)h(X)).

因此只要 η<1/2,含噪风险仍按正比例排序干净错误;当 η=1/2,标签与真概念无关;若已知翻转率大于 1/2 可反转标签,但原模型通常排除它。

直觉

固定独立翻转像给每个标签单独掷一枚偏硬币:它会把所有分类器的观测风险向同一个噪声底座 η 抬高,并把规则间差距压缩为原来的 12η,却不会改变谁更好。随着 η 接近 1/2,恢复干净概念所需样本急剧增加,因为标签携带的方向性越来越弱。

例子与边界

“标签噪声”是泛称。翻转率依赖 x 的 Massart/异方差噪声、集中在决策边界的噪声以及对抗性恶意噪声都不满足固定独立 Bernoulli 机制。现实测量误差只有在这些独立性条件可信时才是本模型,不能看到错标便直接引用其保证。

η=0.1,一个干净错误率 q=0.2 的分类器在观测标签上的错误率为

0.1+(10.2)0.2=0.26,

真概念自身也会有观测错误率 0.1。因此“训练错误无法降到零”与真概念仍在类内并不矛盾;噪声把风险整体抬高并压缩不同规则之间的差为因子 12η

若翻转率在某些 x 上达到 0.49、另一些点为零,虽然处处仍小于 1/2,它已不是固定率 classification noise。若噪声还根据学习器预测故意反转,更违反独立性。算法的容噪保证必须与真实噪声机制逐项匹配。

从样本角度看,同一个 x 被重复观测时标签可能不同,但这些翻转在给定干净概念后独立。若一个传感器发生持续故障,使某台设备之后的所有标签一起反转,边缘错误率也许仍为 η,联合分布却相关;通过多数重复降低噪声的证明会失效。

推论与应用

该模型介于可实现与不可知之间:相对观测标签,类内最优风险是 η 而非零;但风险排序仍由干净错误保持,所以可以恢复目标概念。完全不可知模型没有这一线性关系,只要求接近观测分布下类内最优,不能承诺识别某个隐藏干净概念。

PAC 学习中,噪声使一致性不再可用,算法必须估计带噪风险或调用容噪 oracle;统计查询模型正可利用相关性查询绕开对单个随机标签的依赖。Massart 与 Tsybakov 条件则放宽固定翻转率,用位置依赖的边界噪声刻画更一般的快速率情形。

参考资料
  • Angluin, Laird, “Learning from Noisy Examples,” 1988.
  • Kearns, “Efficient Noise-Tolerant Learning from Statistical Queries,” 1998.
关系图谱14 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组