形式陈述
训练误差有多个最小者时,优化器仍会返回一个具体参数。隐式偏置研究这项选择怎样由更新规则和初始化产生。本页固定线性模型与欧氏梯度下降,完整刻画其极限;这里的“偏置”不是统计估计量期望减去真值的定义。
设 X ∈ R n × d 、y ∈ R n ,训练目标为
L ( w ) = 1 2 ‖ X w − y ‖ 2 2 . 不要求 X 满秩,也不要求 X w = y 有解。由最小二乘与正规方程 公理库 最小二乘与正规方程 Least squares · Normal equations 将目标向量正交投影到矩阵列空间,并以残差正交条件导出正规方程。 ,最小者总存在。记 w † = X + y 为其中最小欧氏范数解,P 0 为到 ker X 的正交投影。
当 X ≠ 0 ,取固定步长
0 < η < 2 ‖ X ‖ 2 2 , 从任意 w 0 执行精确的梯度下降 公理库 梯度下降法 Gradient descent method · Steepest descent method 反复沿当前负梯度方向取步以降低可微目标的基础一阶算法。
w t + 1 = w t − η X T ( X w t − y ) . 则
P 0 w t = P 0 w 0 , w t ⟶ w ∞ = X + y + P 0 w 0 . 这个极限也是唯一的最近初值解:
w ∞ = argmin w ∈ arg min L ‖ w − w 0 ‖ 2 . 因此,极限是最小范数解,当且仅当 P 0 w 0 = 0 ;零初始化是充分条件,但不是唯一选择。若 X = 0 ,梯度恒零,任意步长下都保持 w t = w 0 ,不使用含零分母的步长公式。
直觉
矩阵只能看到参数在训练特征张成空间中的分量。每次梯度都是训练特征的线性组合,所以更新只能在这片行空间内移动;正交于所有训练特征的零空间分量没有受到任何力。
当行空间分量走到唯一的最优位置,零空间分量仍保留初始化的值。零初始化因此留下零核分量,得到最小范数解;非零初始化可能留下训练损失看不见的参数。
图片加载失败 行空间更新保留初始零空间偏移 图中的直线 w 1 + w 2 = 1 包含全部训练最小者。两条轨迹的位移始终沿 ( 1 , 1 ) ;它们之间的偏移 ( 1 , − 1 ) 始终不变。优化收敛与选择哪一个最小者由同一更新的两个不同方向解释。
例子与边界
相同训练轨迹,不同未见点预测
取 X = ( 1 , 1 ) 、y = 1 、η = 1 / 4 。记坐标和 s t = w 1 , t + w 2 , t 、差 d t = w 1 , t − w 2 , t ,更新给出
s t + 1 = 1 2 s t + 1 2 , d t + 1 = d t . 从 w 0 = ( 0 , 0 ) 与 w ~ 0 = ( 1 , − 1 ) 出发,两者的初始和都为零,故
w t = ( 1 − 2 − t 2 , 1 − 2 − t 2 ) , w ~ t = w t + ( 1 , − 1 ) .
轮数
从 ( 0 , 0 ) 出发
从 ( 1 , − 1 ) 出发
共同训练损失
0
( 0 , 0 )
( 1 , − 1 )
1 / 2
1
( 1 / 4 , 1 / 4 )
( 5 / 4 , − 3 / 4 )
1 / 8
2
( 3 / 8 , 3 / 8 )
( 11 / 8 , − 5 / 8 )
1 / 32
极限
( 1 / 2 , 1 / 2 )
( 3 / 2 , − 1 / 2 )
0
一般轮数的共同损失为 L ( w t ) = L ( w ~ t ) = 4 − t / 2 。两极限都完全拟合训练点 ( 1 , 1 ) ,但在新输入 x = ( 1 , 0 ) 上分别预测 1 / 2 与 3 / 2 。训练损失无法区分这两个结果;哪个预测更好,还要知道新输入的目标或数据分布。本定理本身不提供泛化优势排序。
不一致数据仍然收敛
取
X = ( 1 0 1 0 ) , y = ( 1 3 ) . 两个训练响应无法同时拟合,最小者集合是 { ( 2 , b ) : b ∈ R } 。从 ( a , b ) 出发,第一坐标满足
w 1 , t + 1 − 2 = ( 1 − 2 η ) ( w 1 , t − 2 ) , 第二坐标始终为 b 。对 0 < η < 1 ,极限为 ( 2 , b ) ,最终损失为 1 ,而不是零。因此“最小二乘极限”不能在一般情形被改写成“插值解”。
步长与坐标的作用
前一个单样本例子的 ‖ X ‖ 2 2 = 2 ,安全区间是 0 < η < 1 。若从零出发取端点 η = 1 ,坐标和在 0 与 2 间振荡;取更大的步长则误差绝对值增长。严格步长区间保证所有初值收敛,不排除个别已经最优的初值在区间外仍保持不动。
“最小范数”还依赖参数坐标。把同一预测器改写为 w = diag ( 2 , 1 ) θ ,从 θ 0 = 0 对 θ 做欧氏梯度下降,设计矩阵变成 ( 2 , 1 ) 。取 0 < η θ < 2 / 5 ,极限是 θ ∞ = ( 2 / 5 , 1 / 5 ) ,对应 w ∞ = ( 4 / 5 , 1 / 5 ) 。这次最小化的是满足训练等式时的 w 1 2 / 4 + w 2 2 。表示的预测函数类没有改变,更新的几何却变了。
推论与应用
逐个奇异方向证明收敛
对非零 X 取紧奇异值分解 公理库 奇异值分解 Singular value decomposition · SVD 任意有限维线性映射都可在正交规范基下表示为非负对角伸缩。
X = U r Σ r V r T , Σ r = diag ( σ 1 , … , σ r ) , σ i > 0. V r 的列张成行空间,P 0 = I − V r V r T 。因为 P 0 X T = 0 ,直接将更新乘以 P 0 即得零空间不变量。
令 a i , t = v i T w t 。沿第 i 个正奇异方向,矩阵迭代变成一个标量递推:
a i , t + 1 = ( 1 − η σ i 2 ) a i , t + η σ i u i T y . 移去不动点后展开,得到
a i , t = u i T y σ i + ( 1 − η σ i 2 ) t ( a i , 0 − u i T y σ i ) . 步长条件使每个 | 1 − η σ i 2 | < 1 。行空间极限因此是
∑ i = 1 r u i T y σ i v i = X + y , 再加上不变的核分量,就得到所述 w ∞ 。y 中与列空间正交的分量被 X T 消掉,所以证明从未要求数据可插值。
定义
q = max 1 ≤ i ≤ r | 1 − η σ i 2 | < 1. 由正交坐标平方求和,有
‖ w t − w ∞ ‖ 2 ≤ q t ‖ w 0 − w ∞ ‖ 2 . 这里最大值只遍历正奇异值。完整更新矩阵在核上有特征值一,不能声称它在整个参数空间严格压缩。它压缩的是同一初始核分量内的误差。
为什么恰好最近,以及能证明什么
所有最小者写成 w † + z ,其中 z ∈ ker X 。把初值正交拆开,得
‖ w † + z − w 0 ‖ 2 2 = ‖ w † − V r V r T w 0 ‖ 2 2 + ‖ z − P 0 w 0 ‖ 2 2 . 第一项与 z 无关,第二项唯一在 z = P 0 w 0 处取零。这证明最近初值性质。另由
‖ w † + z ‖ 2 2 = ‖ w † ‖ 2 2 + ‖ z ‖ 2 2 , 得到最小范数当且仅当初始核分量为零。
显式正则化 公理库 正则化经验风险最小化 regularized ERM · RERM 在经验拟合项上加入结构惩罚,以显式控制解的复杂度与统计—优化权衡。 会修改目标;这里目标没有添加惩罚,选择来自可达的仿射空间。固定本页二次目标与初始化后,允许区间内的不同常步长改变收敛速度,却不改变极限。这不是对任意优化器、非线性参数化或神经网络的结论。
若只为求最小范数解,SVD 数值求解 公理库 用 QR 与 SVD 求最小二乘 Least squares via QR · Least squares via SVD · Numerical least squares 以 QR 作为满列秩最小二乘的默认计算路线,并用 SVD 处理秩亏、欠定和最小范数解。 直接给出另一条计算路线。稠密梯度更新不必形成 X T X ,每轮两个矩阵—向量乘法需 O ( n d ) 运算及 O ( n + d ) 工作空间(数据存储另计);所需轮数由正奇异值上的 q 决定。小训练残差、少量迭代或提前停止不能自动替代上述极限结论。
自测
仍用 X = ( 1 , 1 ) , y = 1 ,若从 ( 2 , 0 ) 出发,极限是什么?初始核投影为 ( 1 , − 1 ) ,所以极限仍为 ( 3 / 2 , − 1 / 2 ) 。两初值不同却有相同核分量时,它们会选择同一个最小者;初值本身不是决定极限的全部信息。
参考资料