“这些量级只有在模型轴也写清后才可比较。可实现与不可知学习决定精度是 $\varepsilon^{ 1}$ 还是 $\varepsilon^{ 2}$,proper/improper 之分决定…”
形式陈述 ​
给定假设类
不可知设定移除零风险假设,目标改为
它并非“完全无假设”:IID、固定损失、比较类和概率目标仍在。对平方回归等一般损失,零风险本就不自然,类内超额风险才是稳定表述。
直觉
若 Bayes 风险为零但类不含 Bayes 规则,问题对
可实现性也不承诺能计算出一致规则。PAC加入样本与概率量词;高效 PAC 再要求多项式时间。存在、统计可学和计算可解是三层问题。
可实现设定给学习器一条很强的证据:类内确实存在零总体风险规则,所以零经验误差候选只需排除“坏规则恰好在样本上幸存”的单侧事件。不可知设定没有这个锚点,学习器必须在两个都带采样噪声的经验风险之间做比较,通常需要双侧控制。
例子与边界
确定标签也可能错设 ​
设
插值不等于可实现 ​
一般损失下,“存在零经验损失规则”也可能没有稳定意义。对连续噪声回归,有限样本可被高次插值多项式逐点穿过,平方训练损失为零,但总体风险未必接近类内最优。不可知目标比较真实风险而非是否插值,正是为了容纳噪声、错设和有限样本偶合。
结构化噪声的中间位置 ​
结构化噪声模型不会简单落在二选一标签中。Classification noise 仍有隐藏的类内真概念,但观测风险最低值为
推论与应用
两种设定对应不同证明信息。可实现一致分类知道类内最优经验与总体风险都为零,可只控制坏规则“幸存”的单侧事件;不可知学习不知道最优经验值,需要比较两个带噪风险并通常做双侧估计。这正是有限类样本率从
PAC 定义会据此分成可实现与不可知版本:前者要求以高概率输出风险至多
实践中,选择分支并不是问“训练误差是否已经为零”,而是问数据生成分布是否满足类内零风险假设。若这一假设无法辩护,应报告相对类内最优的超额风险;若另有 Massart、Tsybakov 等噪声结构,则应显式使用相应中间条件,以换取比完全不可知更精细的速率。
参考资料
- Kearns, Vazirani, An Introduction to Computational Learning Theory, 1994.
- Shalev-Shwartz, Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Chs. 2–3.