Skip to content

定理Theorem

线性平方损失的隐式偏置

Implicit bias in linear regression · Gradient descent minimum-norm bias · 线性回归隐式正则化

证明固定步长梯度下降在任意线性平方损失上保留初始零空间分量,并选择离初值最近的最小二乘解。

形式陈述 ​

训练误差有多个最小者时,优化器仍会返回一个具体参数。隐式偏置研究这项选择怎样由更新规则和初始化产生。本页固定线性模型与欧氏梯度下降,完整刻画其极限;这里的“偏置”不是统计估计量期望减去真值的定义。

设 X∈Rn×d、y∈Rn,训练目标为

L(w)=12‖Xw−y‖22.

不要求 X 满秩,也不要求 Xw=y 有解。由最小二乘与正规方程,最小者总存在。记 w†=X+y 为其中最小欧氏范数解,P0 为到 ker⁡X 的正交投影。

当 X≠0,取固定步长

0<η<2‖X‖22,

从任意 w0 执行精确的梯度下降

wt+1=wt−ηXT(Xwt−y).

则

P0wt=P0w0,wt⟶w∞=X+y+P0w0.

这个极限也是唯一的最近初值解:

w∞=argminw∈arg⁡minL‖w−w0‖2.

因此,极限是最小范数解,当且仅当 P0w0=0;零初始化是充分条件,但不是唯一选择。若 X=0,梯度恒零,任意步长下都保持 wt=w0,不使用含零分母的步长公式。

直觉

矩阵只能看到参数在训练特征张成空间中的分量。每次梯度都是训练特征的线性组合,所以更新只能在这片行空间内移动;正交于所有训练特征的零空间分量没有受到任何力。

当行空间分量走到唯一的最优位置,零空间分量仍保留初始化的值。零初始化因此留下零核分量,得到最小范数解;非零初始化可能留下训练损失看不见的参数。

行空间更新保留初始零空间偏移

图中的直线 w1+w2=1 包含全部训练最小者。两条轨迹的位移始终沿 (1,1);它们之间的偏移 (1,−1) 始终不变。优化收敛与选择哪一个最小者由同一更新的两个不同方向解释。

例子与边界

相同训练轨迹,不同未见点预测 ​

取 X=(1,1)、y=1、η=1/4。记坐标和 st=w1,t+w2,t、差 dt=w1,t−w2,t,更新给出

st+1=12st+12,dt+1=dt.

从 w0=(0,0) 与 w~0=(1,−1) 出发,两者的初始和都为零,故

wt=(1−2−t2,1−2−t2),w~t=wt+(1,−1).
轮数 从 (0,0) 出发 从 (1,−1) 出发 共同训练损失
0 (0,0) (1,−1) 1/2
1 (1/4,1/4) (5/4,−3/4) 1/8
2 (3/8,3/8) (11/8,−5/8) 1/32
极限 (1/2,1/2) (3/2,−1/2) 0

一般轮数的共同损失为 L(wt)=L(w~t)=4−t/2。两极限都完全拟合训练点 (1,1),但在新输入 x=(1,0) 上分别预测 1/2 与 3/2。训练损失无法区分这两个结果;哪个预测更好,还要知道新输入的目标或数据分布。本定理本身不提供泛化优势排序。

不一致数据仍然收敛 ​

取

X=(1010),y=(13).

两个训练响应无法同时拟合,最小者集合是 {(2,b):b∈R}。从 (a,b) 出发,第一坐标满足

w1,t+1−2=(1−2η)(w1,t−2),

第二坐标始终为 b。对 0<η<1,极限为 (2,b),最终损失为 1,而不是零。因此“最小二乘极限”不能在一般情形被改写成“插值解”。

步长与坐标的作用 ​

前一个单样本例子的 ‖X‖22=2,安全区间是 0<η<1。若从零出发取端点 η=1,坐标和在 0 与 2 间振荡;取更大的步长则误差绝对值增长。严格步长区间保证所有初值收敛,不排除个别已经最优的初值在区间外仍保持不动。

“最小范数”还依赖参数坐标。把同一预测器改写为 w=diag(2,1)θ,从 θ0=0 对 θ 做欧氏梯度下降,设计矩阵变成 (2,1)。取 0<ηθ<2/5,极限是 θ∞=(2/5,1/5),对应 w∞=(4/5,1/5)。这次最小化的是满足训练等式时的 w12/4+w22。表示的预测函数类没有改变,更新的几何却变了。

推论与应用

逐个奇异方向证明收敛 ​

对非零 X 取紧奇异值分解

X=UrΣrVrT,Σr=diag(σ1,…,σr),σi>0.

Vr 的列张成行空间,P0=I−VrVrT。因为 P0XT=0,直接将更新乘以 P0 即得零空间不变量。

令 ai,t=viTwt。沿第 i 个正奇异方向,矩阵迭代变成一个标量递推:

ai,t+1=(1−ησi2)ai,t+ησiuiTy.

移去不动点后展开,得到

ai,t=uiTyσi+(1−ησi2)t(ai,0−uiTyσi).

步长条件使每个 |1−ησi2|<1。行空间极限因此是

∑i=1ruiTyσivi=X+y,

再加上不变的核分量,就得到所述 w∞。y 中与列空间正交的分量被 XT 消掉,所以证明从未要求数据可插值。

定义

q=max1≤i≤r|1−ησi2|<1.

由正交坐标平方求和,有

‖wt−w∞‖2≤qt‖w0−w∞‖2.

这里最大值只遍历正奇异值。完整更新矩阵在核上有特征值一,不能声称它在整个参数空间严格压缩。它压缩的是同一初始核分量内的误差。

为什么恰好最近,以及能证明什么 ​

所有最小者写成 w†+z,其中 z∈ker⁡X。把初值正交拆开,得

‖w†+z−w0‖22=‖w†−VrVrTw0‖22+‖z−P0w0‖22.

第一项与 z 无关,第二项唯一在 z=P0w0 处取零。这证明最近初值性质。另由

‖w†+z‖22=‖w†‖22+‖z‖22,

得到最小范数当且仅当初始核分量为零。

显式正则化会修改目标;这里目标没有添加惩罚,选择来自可达的仿射空间。固定本页二次目标与初始化后,允许区间内的不同常步长改变收敛速度,却不改变极限。这不是对任意优化器、非线性参数化或神经网络的结论。

若只为求最小范数解,SVD 数值求解直接给出另一条计算路线。稠密梯度更新不必形成 XTX,每轮两个矩阵—向量乘法需 O(nd) 运算及 O(n+d) 工作空间(数据存储另计);所需轮数由正奇异值上的 q 决定。小训练残差、少量迭代或提前停止不能自动替代上述极限结论。

自测 ​

仍用 X=(1,1),y=1,若从 (2,0) 出发,极限是什么?初始核投影为 (1,−1),所以极限仍为 (3/2,−1/2)。两初值不同却有相同核分量时,它们会选择同一个最小者;初值本身不是决定极限的全部信息。

参考资料
  • Suriya Gunasekar, Jason Lee, Daniel Soudry, and Nathan Srebro, “Characterizing Implicit Bias in Terms of Optimization Geometry”, PMLR 80, ICML 2018,§§2.1–2.2:可实现线性模型的最近初值刻画与优化几何。其一般损失结论以到达零损失为条件;本文另给固定平方损失的显式收敛证明。
  • Charles L. Byrne, Applied and Computational Linear Algebra: A First Course, 作者公开稿,访问于2026年,§26.2.2.2、式 (26.4)、Theorem 26.1,正文 pp. 314–315:Landweber 迭代与最近最小二乘解。该在线稿未明确版本日期;此处章节编号对应所链接稿件。
关系图谱11 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

使用的工具