形式陈述
给定样本 、核 的 RKHS 与 ,核岭回归固定采用目标
由表示定理公理库表示定理representer theorem · generalized representer theorem · 有限核展开定理说明点值损失加单调 RKHS 范数惩罚的最优解可取为有限核截面展开。可取 。令 、,一个标准系数代表满足
来自经验损失前的 。若把损失写成不除以 的求和,系统才是 ;两种 convention 不能在同一 名下混用。
这里推进的是 RKHS 的 representer/Gram 解法。普通线性 ridge 的偏差—方差解释、参数收缩和一般正则化框架属于既有正则化 ERM,不因换成核表示而重复定义。
直觉
平方损失希望训练预测 靠近 ,RKHS 范数则惩罚在核几何中复杂的函数。对 Gram 特征方向 ,训练拟合为
所以第 个正特征方向乘上 。小特征值方向被更强地压缩,零特征方向完全无法由这些核截面拟合。
正则项还让 严格正定,即使 奇异也可解。这个数值事实不表示原始系数表示天然唯一:Gram 零空间中的系数表示零函数;公式只是选择了一个确定且方便计算的代表。
例子与边界
取两点的 Gram 矩阵与标签
于是
其逆为 ,故 。训练预测为 ;平均平方损失是 ,范数平方 ,正则项也是 ,总目标为 。零函数目标为 ,所以这一步可直接核验改进。
若 ,系统可能不可逆,且当 不在 的像空间时不能插值;应使用最小二乘或伪逆并明确选择准则。若核本身不 PSD,目标中的“范数”解释失效,线性系统可有负曲率,不能只靠加一个小 jitter 宣称得到 KRR。
若另设未惩罚截距 ,同一 损失 convention 下可取由以下方程选出的标准系数代表:
其中第二行即 ;也可用训练权重一致地中心化 与 后求核部分。把常数列直接塞进核会同时改变其惩罚方式。大样本下稠密系统的存储与求解是主要边界,迭代法或低秩近似会引入额外数值误差。
推论与应用
预测是训练响应的线性平滑器,帽子矩阵为 。其迹常作为有效自由度,并可用于留一法或超参数选择推导;若同一数据用于反复选核与 ,仍需把选择过程纳入验证。
在线性平滑器 convention 下,若 ,第 点的留一残差可由全数据残差除以 得到,无需重解 次系统。这是平方损失与固定核矩阵的代数结果;若核或 在每个折内重新选择,快捷公式不再覆盖完整流程。
对向量值输出,可在共享标量核下逐列求解同一个线性系统;若输出坐标相关,则需算子值核,已超出本页。KRR 给条件均值型点预测,不自动提供噪声方差或概率后验;与高斯过程回归的公式相似需要额外概率模型才能解释为后验均值。
参考资料
- Craig Saunders, Alex Gammerman, and Volodya Vovk, “Ridge Regression Learning Algorithm in Dual Variables,” Proceedings of ICML, 1998, pp. 515–521.
- Bernhard Schölkopf and Alexander J. Smola, Learning with Kernels, MIT Press, 2002, Sec. 4.2.
- Ingo Steinwart and Andreas Christmann, Support Vector Machines, Springer, 2008, Secs. 5.5–5.6.