形式陈述
给定 m ≥ 1 个样本 ( x i , y i ) i = 1 m 、核 k 的RKHS 理路 再生核 Hilbert 空间 reproducing kernel Hilbert space · RKHS · 再生核希尔伯特空间 把点值连续的函数 Hilbert 空间与其唯一再生核对应起来。 H k 与 λ > 0 ,核岭回归是正则化经验风险最小化 理路 正则化经验风险最小化 regularized ERM · RERM 在经验拟合项上加入结构惩罚,以显式控制解的复杂度与统计—优化权衡。 的平方损失、平方范数特例,固定采用目标
min f ∈ H k 1 m ∑ i = 1 m ( f ( x i ) − y i ) 2 + λ ‖ f ‖ H k 2 . 由表示定理 理路 表示定理 representer theorem · generalized representer theorem · 有限核展开定理 说明点值损失加单调 RKHS 范数惩罚的最优解可取为有限核截面展开。 可取 f ( ⋅ ) = ∑ i α i k ( ⋅ , x i ) 。令 K i j = k ( x i , x j ) 、y = ( y 1 , … , y m ) ⊤ ,一个标准系数代表满足
( K + m λ I ) α = y , f ^ ( x ) = k X ( x ) ⊤ α . m λ 来自经验损失前的 1 / m 。若把损失写成不除以 m 的求和,系统才是 ( K + λ I ) α = y ;两种 convention 不能在同一 λ 名下混用。
这个系统同时给出最优解存在性与函数唯一性。记 ρ = m λ ,解出 α 并定义 f ^ = ∑ i α i k x i 。由 K α − y = − ρ α 和再生性质,目标在 f ^ 处沿任意 g ∈ H k 的一次项为零;因此
J ( f ^ + g ) − J ( f ^ ) = 1 m ∑ i g ( x i ) 2 + λ ‖ g ‖ H k 2 . 右侧非负,且只在 g = 0 时为零。这样,有限系统确实产生唯一最优函数,而不需预先假定无限维问题已达到最小值。
若一次核求值成本为 C k ,构造训练 Gram 矩阵需 O ( m 2 C k ) ;在稠密、单位成本标量运算模型下,对正定系统作 Cholesky 分解并求解需 O ( m 3 ) 算术工作与 O ( m 2 ) 数值存储。保存系数后,单个标量响应的查询需 m 次核求值及 O ( m ) 次加乘,即 O ( m C k + m ) ;训练输入的存储、核求值所需工作空间及数值精度成本另计。
推论与应用
预测是训练响应的线性平滑器,帽子矩阵为 S λ = K ( K + m λ I ) − 1 。其迹常作为有效自由度,并可用于留一法或超参数选择推导;若同一数据用于反复选核与 λ ,仍需把选择过程纳入验证。
有效自由度和噪声方差不是同一个迹
固定训练输入、核和 ρ = m λ > 0 ,令 S = K ( K + ρ I ) − 1 。现在把响应视为 Y = μ + ε ,其中 μ ∈ R m 是这些输入上的真实均值,E ε = 0 、Cov ( ε ) = σ 2 I m 。核和 ρ 不依赖这些响应;若由独立资料预先确定,则先条件于那些冻结的信息。此处不要求 μ 必须能由有限核截面精确表示。
预测误差分为 ( S − I ) μ + S ε 。固定项与均值零项的交叉期望为零,故偏差—方差分解 理路 偏差、方差与均方误差 Bias–variance decomposition · Mean squared error 平方损失下将点态估计风险精确拆成抽样波动与系统位移,并说明两者的权衡边界。 给出
R ρ := 1 m E ‖ S Y − μ ‖ 2 2 = ‖ ( I − S ) μ ‖ 2 2 m + σ 2 m tr ( S 2 ) . 若 K 的特征值为 ν j ≥ 0 ,记 g j = ν j / ( ν j + ρ ) ,则 tr ( S ) = ∑ j g j ,而方差使用 tr ( S 2 ) = ∑ j g j 2 。因为 0 ≤ g j < 1 ,有 tr ( S 2 ) ≤ tr ( S ) ;两者在非平凡 ridge 收缩下通常不相等,不能把有效自由度直接代入精确方差公式。
tr ( S ) 也有明确统计含义。当 σ 2 > 0 时,
1 σ 2 ∑ i = 1 m Cov ( ( S Y ) i , Y i ) = tr ( S ) . 所以它量的是拟合值对本次响应的总敏感度。训练残差的均方期望为
1 m E ‖ Y − S Y ‖ 2 2 = ‖ ( I − S ) μ ‖ 2 2 m + σ 2 m { m − 2 tr ( S ) + tr ( S 2 ) } . 若 Y ′ = μ + ε ′ 是相同设计上的独立新响应,且 E [ ε ′ ] = 0 ,噪声协方差同为 σ 2 I m ,则新响应风险是 R ρ + σ 2 。它与训练残差均方期望之差恰为 2 σ 2 tr ( S ) / m 。因此两个迹分别出现在方差与平均训练乐观度中,承担不同工作。
沿用前面两点 Gram 矩阵及 ρ = 1 / 2 ,其特征值为 3 / 2 , 1 / 2 ,所以 g = ( 3 / 4 , 1 / 2 ) ,
tr ( S ) = 5 / 4 、tr ( S 2 ) = 13 / 16 。这次把旧算例标签 ( 1 , − 1 ) T 作为真实均值 μ ,围绕它重复抽取噪声,则
R ρ = 1 4 + 13 σ 2 32 , 1 m E ‖ Y − S Y ‖ 2 2 = 1 4 + 5 σ 2 32 . 新响应风险为 1 / 4 + 45 σ 2 / 32 。其与训练值相差 5 σ 2 / 4 ,正好等于上述自由度公式。这里的重复采样计算没有把旧页的确定性标签算例偷偷改成无噪声结论。
这些风险针对原设计上的均值或独立重复响应。预测新输入 x ∗ 时要分析 k X ( x ∗ ) T ( K + ρ I ) − 1 Y 的偏差和方差,再对目标输入分布平均;仅有训练 Gram 谱不能保证任意新分布上的同一数值风险。
留一公式要固定哪一个正则系数
对 m ≥ 2 ,先固定未归一化 目标中的系数 ρ > 0 :
∑ j ( f ( x j ) − y j ) 2 + ρ ‖ f ‖ 2 。令
A ρ = ( K + ρ I ) − 1 , α ρ = A ρ y , S ρ = K A ρ . 在每个留一子问题中只删去一个平方损失、仍保留同一 ρ ,块消元给出
y i − f ^ − i , ρ ( x i ) = ( α ρ ) i ( A ρ ) i i = y i − ( S ρ y ) i 1 − ( S ρ ) i i . 第二个等号来自 I − S ρ = ρ A ρ ;A ρ 严格正定,故分母为正。一次分解即可取得全部这些留一残差。
本页原始平均损失用 ρ = m λ 。若删点后改用 1 / ( m − 1 ) 的平均损失并保持数值 λ 不变,则折内系数为 ρ ′ = ( m − 1 ) λ ,应先用 K + ρ ′ I 构造全样本辅助矩阵,再套上式;原先的 S λ = K ( K + m λ I ) − 1 不能直接使用。等价地,若坚持用原矩阵,就须把折内平均损失的系数改为 m λ / ( m − 1 ) 。
例如 K = 1 1 ⊤ 、m = 2 、y = ( 1 , 0 ) ⊤ 、λ = 1 / 4 。原全样本拟合值均为 2 / 5 ,直接套原平滑器会给第二点的留一预测 2 / 3 。但保持平均损失系数 1 / 4 、只用第一点训练,常数函数的目标是 ( s − 1 ) 2 + s 2 / 4 ,最优预测为 4 / 5 。差别来自正则系数的归一化,不是核矩阵奇异。若每折还重新选核、带宽或正则参数,则须把这些步骤纳入完整验证流程。
GCV 把逐点杠杆换成平均杠杆
上面的固定 ρ 留一公式保留了每个位置的杠杆 S i i 。记 e = ( I − S ) y ,则
CV l o o ( ρ ) = 1 m ∑ i = 1 m e i 2 ( 1 − S i i ) 2 . 广义交叉验证(GCV)改用平均杠杆 tr ( S ) / m :
GCV ( ρ ) = ‖ ( I − S ) y ‖ 2 2 / m { 1 − tr ( S ) / m } 2 . 这里 ρ > 0 ,且有限 PSD 矩阵的全部收缩因子小于一,故分母正。如果各个 S i i 相同,GCV 与这套固定惩罚的 LOO 恰好相等;不等杠杆时,这一步是替换,并非代数恒等式。
取 m = 2 、ρ = 1 、K = diag ( 9 , 1 / 9 ) 、y = ( 1 , 1 ) T 。则
S = diag ( 9 / 10 , 1 / 10 ) 、e = ( 1 / 10 , 9 / 10 ) T 。每个真实留一残差都等于一,故 CV l o o = 1 ,但
GCV = ( 1 / 100 + 81 / 100 ) / 2 ( 1 − 1 / 2 ) 2 = 41 25 = 1.64 . 把两个截然不同的杠杆平均掉,便改变了分数。GCV 也不是任意有限样本下新响应风险的无偏估计:在同一个 S 、μ = 0 、σ 2 = 1 的模型中,E [ GCV ] = 41 / 25 ,而独立新响应风险为
1 + tr ( S 2 ) / 2 = 141 / 100 。
GCV 的一个结构优势是旋转不变性。若同时把 y 换为 Q y 、S 换为 Q S Q T ,其中 Q 为正交矩阵,残差范数与迹都不变,因此 GCV 不变。逐点 LOO 一般会变化,因为旋转后的“删去一条坐标”已不是删去原来的一个观测。这个性质解释了 GCV 的构造,但不证明它在每个设计上优于 LOO。
调参时应声明扫描的是固定未归一化系数 ρ ,还是随折样本数换算的平均损失系数 λ ;这里沿用前面的固定 ρ 规则。选出最小 GCV 后,该最小值也不是最终模型的独立测试评价。若核、输入预处理或 ρ 都从响应中调整,固定 S 的风险账本要改成整套选择流程的分析。
与有限时间迭代的接口
线性模型早停 理路 线性模型早停的谱过滤 Early stopping spectral filter · Finite-time Landweber regularization 对零初始化线性梯度下降推导有限时刻过滤因子和精确风险,并在已知信号半径与噪声方差时,不看响应地选择有限网格中的停止轮数。 把谱因子改成 1 − ( 1 − η d ) t ,再用同一偏差—方差账本评价有限轮次。在线性核 K = X X T 下,d 为 X T X / m 的正特征值,ridge 因子正好为 d / ( d + λ ) 。两者都逐方向收缩,却通常不能用一个 λ 精确匹配全部早停方向;该页给出双特征值的明确反例。
对向量值输出,可在共享标量核下逐列求解同一个线性系统,输出坐标相关时这仍是有效的拟合方式。若希望在核中显式建模或利用坐标间的耦合,可以采用算子值核;这种扩展超出本页。KRR 给条件均值型点预测,不自动提供噪声方差或概率后验;与高斯过程回归的公式相似需要额外概率模型才能解释为后验均值。
曲率半范数与多个平滑组件
三次平滑样条 理路 三次平滑样条与未惩罚零空间 Cubic smoothing spline · Smoothing spline · 平滑样条 从二阶导数惩罚构造带仿射零空间的表示式,解自然样条的带状系统,并区分曲率惩罚与系数差分惩罚。 的连续曲率罚项不惩罚仿射函数,其平滑矩阵保留两个收缩因子一,因此EDF强平滑极限为二。固定平滑器的偏差、方差与迹账本仍沿用本页,但LOO分母为正需另外检查删除后至少两个互异位置能识别该零空间;不能使用纯KRR中全部因子严格小于一的理由。
加性样条回拟合 理路 加性样条模型与回拟合 Additive spline model · Spline backfitting · 加性模型回拟合 把多个中心化样条组件放入同一平方损失,以部分残差轮流拟合,并核验联合零空间、分量可识别性和真实停止残差。 则将多个中心化组件放入同一个损失。总平滑矩阵由联合带惩罚正规方程决定,组件相关时不能把各自独立拟合的EDF直接相加。其求解和组件可识别性取决于联合设计与未惩罚方向的交,而不只是每个单变量平滑器能否单独求出。