形式陈述
对固定设计 x i j 、i = 1 , … , n 、j = 1 , … , d ,加性均值模型写为
m ( x 1 , … , x d ) = β 0 + ∑ j = 1 d f j ( x j ) . 每个 f j 由一组预先固定且属于 H 2 的样条基表示,也就是函数及一阶导数绝对连续、弱二阶导数平方可积。次数 p ≥ 2 且内部重数至多 p − 1 是一个充分条件;允许斜率跳跃的分段直线不能只用跨度内零二阶导数冒充零曲率。用训练样本的经验均值中心化每一组基,仅删除作为整个函数恒为零或函数层面线性依赖的冗余方向,并同步变换曲率矩阵,得到设计矩阵 B j ,满足 1 T B j = 0 。函数基独立不要求观测设计满列秩:两个函数可以在所有训练点取值相同而曲率不同,不能只凭样本列重复随意删除。在整个输入区间上也使用同一批中心化后的基函数,以便定义新输入预测;不能在测试批次重新中心化。
令 Ω j ⪰ 0 为对应曲率矩阵,λ j > 0 固定,求
(1) min β 0 , θ 1 , … , θ d ‖ y − β 0 1 − ∑ j B j θ j ‖ 2 + ∑ j λ j θ j T Ω j θ j . 这是正则化经验风险 理路 正则化经验风险最小化 regularized ERM · RERM 在经验拟合项上加入结构惩罚,以显式控制解的复杂度与统计—优化权衡。 的一类平方损失模型;用满节点自然样条时,各组件来自三次平滑样条 理路 三次平滑样条与未惩罚零空间 Cubic smoothing spline · Smoothing spline · 平滑样条 从二阶导数惩罚构造带仿射零空间的表示式,解自然样条的带状系统,并区分曲率惩罚与系数差分惩罚。 ,也可预先限制较少节点。中心化使 β ^ 0 = y ¯ ,但它只去掉分量之间转移常数的歧义,并不自动保证其余分解唯一。
记 B = [ B 1 ⋯ B d ] 、y c = y − y ¯ 1 ,以及
P = diag ( λ 1 Ω 1 , … , λ d Ω d ) , H = B T B + P , b = B T y c . 本页的唯一解与收敛接口要求
即 (2) ker B ∩ ker P = { 0 } , 即 H ≻ 0. 输入还应给定初值、固定的组件访问顺序、残差容差与最大扫掠数。输出各组件、截距、总预测、目标值及 H θ − b 的实际范数;预算用尽不能标为已达到要求的精度。这里处理Gaussian恒等链接的平方损失拟合;只有拟合公式需要平方损失,下面的固定设计风险不额外要求误差Gaussian。其他链接的广义加性模型还需不同的似然和外层求解,不能直接继承本页算法。
直觉
单独把每个变量与原始 y 平滑,会让几个相关变量重复解释同一部分响应。回拟合(backfitting)在更新第 j 个组件时,先扣除其他组件当前已经解释的部分,再只拟合剩余响应。
设 A j = B j T B j + λ j Ω j 。固定其他块,式(1)的最优条件给出一次精确更新
(3) r j = y c − ∑ ℓ ≠ j B ℓ θ ℓ , A j θ j n e w = B j T r j . H ≻ 0 保证每个 A j ≻ 0 。顺序执行时,前面已经更新的组件要用本轮新值,后面用旧值。这正是联合正规方程的块Gauss–Seidel定常迭代 理路 定常线性迭代法 Stationary iterative methods 以固定矩阵分裂统一 Jacobi、Gauss–Seidel 与 SOR,并由迭代矩阵谱半径判定任意初值下的收敛。 ,可以直接采用这种块线性迭代求解;“多做几次单变量回归”本身并不保证联合最优。
总残差缓存 r = y c − ∑ j B j θ j 可沿用部分残差缓存 理路 Lasso 坐标下降 Lasso coordinate descent · Lasso cyclic coordinate minimization 用部分残差和列范数逐坐标精确最小化 Lasso,并保持残差缓存与可行对偶证书一致。 的思想:先加回 B j θ j 得到 r j ,解本块后减去 B j θ j n e w 。这里块求解是二次惩罚的线性系统,绝对值软阈值不适用。所有 A j 可在固定设计、固定惩罚下预分解,若每轮又重选 λ j ,就已改变了正在求解的目标。
例子与边界
两个相关的曲率组件
取三个观测,第一坐标 X 1 = ( 0 , 1 , 2 ) ,第二坐标 X 2 = ( 0 , 2 , 1 ) 。在 [ 0 , 2 ] 上仅使用各一维的二次样条子空间:
h 1 ( t ) = 3 ( t − 1 ) 2 − 2 , h 2 ( t ) = − 3 ( t − 1 ) 2 + 2. 两条基函数在各自训练坐标上的均值为零。列向量是
u = ( 1 , − 2 , 1 ) T , v = ( − 1 , − 1 , 2 ) T , u T u = v T v = 6 , u T v = 3. 各曲率积分为 ∫ 0 2 ( h j ″ ) 2 = 72 。取 λ 1 = λ 2 = 1 / 12 、y = u + 2 v = ( − 1 , − 4 , 5 ) ,截距为零,联合方程为
(4) H = ( 12 3 3 12 ) , b = ( 12 15 ) , θ ^ = ( 11 / 15 , 16 / 15 ) T . 从零开始按第一、第二组件的顺序扫掠,递推为
a k + 1 = 1 − b k / 4 , b k + 1 = 5 / 4 − a k + 1 / 4. 第一轮得到 ( 1 , 1 ) ,第二轮 ( 3 / 4 , 17 / 16 ) ,极限为式(4)。消去 a 得 b k + 1 = 1 + b k / 16 ,故第二组件的误差每轮精确乘 1 / 16 。单独各自拟合原响应却会给 ( 1 , 5 / 4 ) ,不满足联合方程。
最终拟合值为 ( − 1 / 3 , − 38 / 15 , 43 / 15 ) ,残差为 ( − 2 / 3 , − 22 / 15 , 32 / 15 ) 。残差平方和 536 / 75 ,罚项 6 ( a 2 + b 2 ) = 754 / 75 ,总目标为 86 / 5 。第一轮目标是18,第二轮是 1101 / 64 ,最终更低;可用联合方程与目标两种方式核验结果。
图片加载失败 中心化仍可能留有共曲率混淆
若两个坐标完全相同且不是常数,例如都取 ( 0 , 1 , 2 ) ,且两组件都含未惩罚的线性函数,取同一个中心化列 z = X − X ¯ 1 。把 f 1 改成 f 1 + t z ,同时把 f 2 改成 f 2 − t z ,总拟合值和所有曲率罚项都不变。中心化没有排除它,因为 z 均值本来就是零。
在响应 y c = z 的极端例中,任何斜率 ( a , b ) 满足 a + b = 1 都达到零目标;从零先更新第一块得 ( 1 , 0 ) ,倒序则得 ( 0 , 1 ) 。两者预测相同,组件解释不同。这个现象称为共曲率或concurvity的一种精确退化情形。给组件另加ridge会选择一种分配,但那是在改变惩罚,不能把新解解释成数据本身已经识别出两个效应。
推论与应用
唯一性要查联合零空间
对任意块向量 δ ,
δ T H δ = ‖ ∑ j B j δ j ‖ 2 + ∑ j λ j δ j T Ω j δ j . 所有项非负,所以正定当且仅当不存在既相互抵消又全部不受罚的非零组件组合,这就是式(2)。在每个坐标有互异观测、各组件采用完整自然三次样条并做中心化的情形,未惩罚组件只剩各坐标的中心化直线。因此若 [ 1 , X 1 , … , X d ] 满列秩,条件成立;若有线性依赖,曲率惩罚无法消除这份分解歧义。有限基的坐标冗余须先删掉,否则还会出现表示层面的非唯一。
即使条件不成立,任何两个最小点的总拟合值仍相同:对两个最小点取中点,二次目标的凸性等号强迫总拟合差的平方范数为零。唯一的总拟合并不等于唯一的组件,也不等于在训练支持之外能识别真实机制。统计或因果解释另需模型和设计假设。
复用块迭代机制,给出可用停止证书
固定 H ≻ 0 时,块Gauss–Seidel收敛可由既有定常迭代理论使用。也可按已有循环精确最小化机制核验:更新第 j 块的下降恰为 Δ j T A j Δ j ;目标有下界使各步位移趋零,正定联合二次型使迭代有界。每个聚点的所有块梯度均为零,从而是唯一解,故整列收敛。应用这份收敛论证时,关键是先检查样条组件是否真的使联合系统正定。
若有已证下界 0 < γ ≤ λ min ( H ) ,对真实正规方程残差 q = H θ − b 有
‖ θ − θ ^ ‖ ≤ ‖ q ‖ / γ , J ( θ ) − J ( θ ^ ) = q T H − 1 q ≤ ‖ q ‖ 2 / γ . 当前例 γ = 9 。只比较两轮组件变化很小,若没有收缩或残差界,不能保证误差已经小。每次完整检查应从当前组件重建总残差;缓存漂移、非有限值、秩检查失败和达到预算分别报告。
若第 j 块有 q j 列,直接稠密预处理与分解约需 O ( n q j 2 + q j 3 ) ;缓存总残差后,一轮约为 O ( ∑ j ( n q j + q j 2 ) ) 。利用B基局部支撑可减小矩阵构造代价,但总工作仍须计入所有组件、实际扫掠数和证书检查次数。
风险、自由度与迁移
固定设计、基、惩罚和中心化规则后,收敛的总拟合是线性平滑器
S = 1 n 1 1 T + B H − 1 B T . 直接复用固定平滑器的风险与有效自由度账本 理路 核岭回归 kernel ridge regression · KRR · least-squares regularization network 用表示定理把 RKHS 平方损失正则化化为一个 Gram 线性系统。 :若 Y = μ + ε 、E ε = 0 、协方差 σ 2 I ,方差项用 tr ( S 2 ) ,响应敏感度用 tr ( S ) 。式(4)例的中心化Gram特征值为9和3,罚项为 6 I ,所以总收缩因子为 ( 1 , 3 / 5 , 1 / 3 ) ,EDF为 29 / 15 ,方差迹为 331 / 225 。不能把各单变量独立平滑的EDF相加:组件相关性进入联合系统。
迁移。 将第二坐标改为与第一相同但仍保留上例的两个有正曲率罚项的二次基,两个系数虽可在拟合项中相互抵消,罚项却不为零,H 仍正定。问题不在“出现重复变量”这句话本身,而在重复方向是否同时落入惩罚零空间。
自测一。 若 m ( x 1 , x 2 ) = x 1 x 2 且两个坐标独立、各以相同概率取 − 1 , 1 ,加性模型能精确表达它吗?不能。其最佳总体平方损失加性投影为零,因为对任一坐标条件平均都为零,最小风险为1;四个支持点上的混合差分为4,而任何加性函数的该差分为零。回拟合收敛只证明给定模型内的优化,不会凭迭代次数创造缺失的交互项。
自测二。 当前两组件例停止在第一轮 ( 1 , 1 ) ,其 q = ( 3 , 0 ) ,能声称误差为零吗?不能。γ = 9 给目标差上界1,实际目标差是 18 − 86 / 5 = 4 / 5 ;一次组件循环结束并不等于联合系统已解。
参考资料