形式陈述
从可实现分类公理库可实现与不可知学习Realizable learning · Agnostic learning区分类内是否存在零风险解释,以及学习目标是否只是接近类内最优。中的类内真概念 出发,先取 与干净标签 ;再取独立的Bernoulli 随机变量公理库Bernoulli 随机变量Bernoulli random variable只取 0 与 1 且成功概率为 p 的基本随机变量。
观测 。 可未知,但必须固定且噪声与 、其他样本独立。
在二元编码下,
因此只要 ,含噪风险仍按正比例排序干净错误;当 ,标签与真概念无关;若已知翻转率大于 可反转标签,但原模型通常排除它。
直觉
固定独立翻转像给每个标签单独掷一枚偏硬币:它会把所有分类器的观测风险向同一个噪声底座 抬高,并把规则间差距压缩为原来的 ,却不会改变谁更好。随着 接近 ,恢复干净概念所需样本急剧增加,因为标签携带的方向性越来越弱。
例子与边界
“标签噪声”是泛称。翻转率依赖 的 Massart/异方差噪声、集中在决策边界的噪声以及对抗性恶意噪声都不满足固定独立 Bernoulli 机制。现实测量误差只有在这些独立性条件可信时才是本模型,不能看到错标便直接引用其保证。
若 ,一个干净错误率 的分类器在观测标签上的错误率为
真概念自身也会有观测错误率 。因此“训练错误无法降到零”与真概念仍在类内并不矛盾;噪声把风险整体抬高并压缩不同规则之间的差为因子 。
若翻转率在某些 上达到 、另一些点为零,虽然处处仍小于 ,它已不是固定率 classification noise。若噪声还根据学习器预测故意反转,更违反独立性。算法的容噪保证必须与真实噪声机制逐项匹配。
从样本角度看,同一个 被重复观测时标签可能不同,但这些翻转在给定干净概念后独立。若一个传感器发生持续故障,使某台设备之后的所有标签一起反转,边缘错误率也许仍为 ,联合分布却相关;通过多数重复降低噪声的证明会失效。
推论与应用
该模型介于可实现与不可知之间:相对观测标签,类内最优风险是 而非零;但风险排序仍由干净错误保持,所以可以恢复目标概念。完全不可知模型没有这一线性关系,只要求接近观测分布下类内最优,不能承诺识别某个隐藏干净概念。
在PAC 学习公理库PAC 可学习性PAC learnability · Probably Approximately Correct learning在可实现设定中,以有限样本和高概率达到任意小总体错误的可学习性。中,噪声使一致性不再可用,算法必须估计带噪风险或调用容噪 oracle;统计查询模型正可利用相关性查询绕开对单个随机标签的依赖。Massart 与 Tsybakov 条件则放宽固定翻转率,用位置依赖的边界噪声刻画更一般的快速率情形。
参考资料
- Angluin, Laird, “Learning from Noisy Examples,” 1988.
- Kearns, “Efficient Noise-Tolerant Learning from Statistical Queries,” 1998.