Skip to content

分类噪声模型

Classification noise model · Random classification noise

类内真概念的标签以固定且独立的小于二分之一概率翻转。

生成机制

先取 XDX,干净标签为 c(X),其中 c 属于目标概念类;再取独立噪声

NBernoulli(η),0η<1/2,

观测 Y=c(X)Nη 可未知,但必须固定且噪声与 X、其他样本独立。

在二元编码下,

Pr(Yh(X))=η+(12η)Pr(c(X)h(X)).

因此只要 η<1/2,含噪风险仍按正比例排序干净错误;当 η=1/2,标签与真概念无关;若已知翻转率大于 1/2 可反转标签,但原模型通常排除它。

“标签噪声”是泛称。翻转率依赖 x 的 Massart/异方差噪声、集中在决策边界的噪声以及对抗性恶意噪声都不满足固定独立 Bernoulli 机制。现实测量误差只有在这些独立性条件可信时才是本模型,不能看到错标便直接引用其保证。

η=0.1,一个干净错误率 q=0.2 的分类器在观测标签上的错误率为

0.1+(10.2)0.2=0.26,

真概念自身也会有观测错误率 0.1。因此“训练错误无法降到零”与真概念仍在类内并不矛盾;噪声把风险整体抬高并压缩不同规则之间的差为因子 12η

若翻转率在某些 x 上达到 0.49、另一些点为零,虽然处处仍小于 1/2,它已不是固定率 classification noise。若噪声还根据学习器预测故意反转,更违反独立性。算法的容噪保证必须与真实噪声机制逐项匹配。

从样本角度看,同一个 x 被重复观测时标签可能不同,但这些翻转在给定干净概念后独立。若一个传感器发生持续故障,使某台设备之后的所有标签一起反转,边缘错误率也许仍为 η,联合分布却相关;通过多数重复降低噪声的证明会失效。

该模型介于可实现与不可知之间:相对观测标签,类内最优风险是 η 而非零;但风险排序仍由干净错误保持,所以可以恢复目标概念。完全不可知模型没有这一线性关系,只要求接近观测分布下类内最优,不能承诺识别某个隐藏干净概念。

参考资料
  • Angluin, Laird, “Learning from Noisy Examples,” 1988.
  • Kearns, “Efficient Noise-Tolerant Learning from Statistical Queries,” 1998.