“软间隔 SVM 对 $C 0$ 求解 $$ \min {w,b,\xi}\ \frac12 w ^2+C\sum {i=1}^{m}\xi i $$ subject to $$ y i\bi…”
形式陈述 ​
对标签
令 margin 变量
对分数
常数 1 是函数间隔的规范,不是数据固有长度。对线性分类器
直觉
零一损失只问符号是否错误,hinge 还要求正确点越过安全带
Hinge 在 SVM 中的角色是损失、次梯度和 margin 归一化。它对分类是否校准、代理超额风险如何控制零一风险,已由分类代理损失与校准处理;这里不把优化几何重新包装成校准定理。
例子与边界
取三个
平均损失为
与 slack 的联系可逐点复算:
所以
消去 slack 后就是
Hinge 不光滑却有次梯度,并非“无法做梯度优化”。它也不是概率评分规则:大量正 margin 都有零损失,不能从最优分数唯一恢复
推论与应用
线性或 RKHS 分数加平方范数正则得到凸目标;有限样本时表示定理给核展开,soft-margin 原始问题则给等价 slack 形式。支持向量正是落在 margin 上或违反 margin、因而在最优性条件中可能有非零乘子的样本。
由于 hinge 对 margin 是 1-Lipschitz,复合函数类的 Rademacher 分析可用收缩引理把损失波动控制回分数类;常数仍会乘上输入半径与范数约束。若不限制分数类,仅凭损失凸和 Lipschitz 并不能得到有限的分布无关泛化保证。
平方 hinge
参考资料
- Ingo Steinwart and Andreas Christmann, Support Vector Machines, Springer, 2008, Secs. 2.3 and 3.3.
- Shai Shalev-Shwartz and Shai Ben-David, Understanding Machine Learning: From Theory to Algorithms, Cambridge University Press, 2014, Chs. 12 and 15.
- Peter L. Bartlett, Michael I. Jordan, and Jon D. McAuliffe, “Convexity, Classification, and Risk Bounds,” Journal of the American Statistical Association 101(473), 2006, pp. 138–156, doi:10.1198/016214505000000907.