“Perceptron 算法用正 margin 推出有限错误次数,间隔泛化界把 $R/\gamma$ 转成 IID 风险控制,Boosting margin 理论则研究组合分类器在训练样本上的…”
形式陈述 ​
带标签间隔 ​
二分类器只记录
同时记录方向和距离:它为负表示误分类,接近零表示判断脆弱,较大的正值表示该点在函数尺度下远离边界。间隔泛化界用训练样本中“小于某个阈值
线性间隔界 ​
设
对样本
一个标准的Rademacher 泛化界版本表明:对任意固定
常数随 ramp loss 的具体定义而变化,稳定的结构是:总体错误不超过经验低间隔率,加上由归一化半径
推导骨架 ​
取截断 ramp 函数
它夹住 0–1 损失与低间隔指示函数:
函数
即可把 ramp loss 的总体均值控制为经验均值加
直觉
训练错误只看点是否越过边界,间隔还看它离边界多远。Ramp loss 把“负间隔必错、足够大正间隔可靠”之间的区域铺成一段斜坡;斜坡越窄,越接近 0–1 损失,却也因 Lipschitz 常数
界中的两项由此形成真实权衡:提高
例子与边界
数值尺度与归一化 ​
若将
量
考虑二维中两条都正确分类全部训练点的直线。第一条贴近一簇样本,第二条穿过两类之间的宽走廊。两者训练错误都是零,但在同一范数归一化下,第二条允许选择更大的
界因此能够区分两个零训练误差解:它比较的是样本到边界的归一化余量,以及这份余量能覆盖多少训练点。视觉上的“更居中”只有转化为更好的间隔分布后,才会进入定理。
数据后选择 ​
上式对预先固定的
与其他间隔理论的边界 ​
本页控制的是线性或 Lipschitz 打分类的测试错误。Boosting 间隔理论研究加权基学习器组合,归一化方式与复杂度项不同;不能只因都出现
大间隔也不自动解决标签噪声。若训练集中有离群标记,强迫所有点获得正大间隔可能需要巨大范数并恶化
推论与应用
当训练样本全部达到间隔
同一证明模板可推广到一般实值函数类:先选择夹住目标错误的 Lipschitz 代理,再以 Rademacher 复杂度或尺度敏感的 fat-shattering 维控制代理损失。推广时必须重新计算输出范围、Lipschitz 常数与所用范数,不能只替换分类器名称。
参考资料
- Peter L. Bartlett, “The Sample Complexity of Pattern Classification with Neural Networks: The Size of the Weights Is More Important than the Size of the Network,” IEEE Transactions on Information Theory 44(2), 1998.
- Vladimir Vapnik, Statistical Learning Theory, Wiley, 1998, margin and structural-risk chapters.
- Mehryar Mohri, Afshin Rostamizadeh, and Ameet Talwalkar, Foundations of Machine Learning, 2nd ed., MIT Press, 2018, margin-bound chapters.