Skip to content

核岭回归

kernel ridge regression · KRR · least-squares regularization network

用表示定理把 RKHS 平方损失正则化化为一个 Gram 线性系统。

条目类型
算法

形式陈述

给定样本 (xi,yi)i=1m、核 k 的 RKHS Hkλ>0,核岭回归固定采用目标

minfHk1mi=1m(f(xi)yi)2+λfHk2.

表示定理可取 f()=iαik(,xi)。令 Kij=k(xi,xj)y=(y1,,ym),一个标准系数代表满足

(K+mλI)α=y,f^(x)=kX(x)α.

mλ 来自经验损失前的 1/m。若把损失写成不除以 m 的求和,系统才是 (K+λI)α=y;两种 convention 不能在同一 λ 名下混用。

这里推进的是 RKHS 的 representer/Gram 解法。普通线性 ridge 的偏差—方差解释、参数收缩和一般正则化框架属于既有正则化 ERM,不因换成核表示而重复定义。

直觉

平方损失希望训练预测 Kα 靠近 y,RKHS 范数则惩罚在核几何中复杂的函数。对 Gram 特征方向 Kuj=σjuj,训练拟合为

y^=K(K+mλI)1y,

所以第 j 个正特征方向乘上 σj/(σj+mλ)。小特征值方向被更强地压缩,零特征方向完全无法由这些核截面拟合。

正则项还让 K+mλI 严格正定,即使 K 奇异也可解。这个数值事实不表示原始系数表示天然唯一:Gram 零空间中的系数表示零函数;公式只是选择了一个确定且方便计算的代表。

例子与边界

取两点的 Gram 矩阵与标签

K=(11/21/21),y=(11),λ=14,m=2.

于是

K+mλI=(3/21/21/23/2),

其逆为 12(3/21/21/23/2),故 α=(1,1)。训练预测为 Kα=(1/2,1/2);平均平方损失是 1/4,范数平方 αKα=1,正则项也是 1/4,总目标为 1/2。零函数目标为 1,所以这一步可直接核验改进。

λ=0,系统可能不可逆,且当 y 不在 K 的像空间时不能插值;应使用最小二乘或伪逆并明确选择准则。若核本身不 PSD,目标中的“范数”解释失效,线性系统可有负曲率,不能只靠加一个小 jitter 宣称得到 KRR。

若另设未惩罚截距 b,同一 1/m 损失 convention 下可取由以下方程选出的标准系数代表:

(K+mλI110)(αb)=(y0),

其中第二行即 1α=0;也可用训练权重一致地中心化 Ky 后求核部分。把常数列直接塞进核会同时改变其惩罚方式。大样本下稠密系统的存储与求解是主要边界,迭代法或低秩近似会引入额外数值误差。

推论与应用

预测是训练响应的线性平滑器,帽子矩阵为 Sλ=K(K+mλI)1。其迹常作为有效自由度,并可用于留一法或超参数选择推导;若同一数据用于反复选核与 λ,仍需把选择过程纳入验证。

在线性平滑器 convention 下,若 1(Sλ)ii0,第 i 点的留一残差可由全数据残差除以 1(Sλ)ii 得到,无需重解 m 次系统。这是平方损失与固定核矩阵的代数结果;若核或 λ 在每个折内重新选择,快捷公式不再覆盖完整流程。

对向量值输出,可在共享标量核下逐列求解同一个线性系统;若输出坐标相关,则需算子值核,已超出本页。KRR 给条件均值型点预测,不自动提供噪声方差或概率后验;与高斯过程回归的公式相似需要额外概率模型才能解释为后验均值。

参考资料
  • Craig Saunders, Alex Gammerman, and Volodya Vovk, “Ridge Regression Learning Algorithm in Dual Variables,” Proceedings of ICML, 1998, pp. 515–521.
  • Bernhard Schölkopf and Alexander J. Smola, Learning with Kernels, MIT Press, 2002, Sec. 4.2.
  • Ingo Steinwart and Andreas Christmann, Support Vector Machines, Springer, 2008, Secs. 5.5–5.6.
关系图谱6 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组