Skip to content

定理Theorem

最小二乘与正规方程

Least squares · Normal equations

将目标向量正交投影到矩阵列空间,并以残差正交条件导出正规方程。

形式陈述 ​

设 F=R 或 C,A∈Fm×n,b∈Fm。最小二乘问题是

minx∈Fn‖Ax−b‖22.

向量 x⋆ 是最优解,当且仅当残差 r⋆=b−Ax⋆ 与列空间 col(A) 正交;等价地,

A∗(Ax⋆−b)=0,A∗Ax⋆=A∗b.

后一个方程称为正规方程,是关于未知量 x⋆ 的线性方程组。其中 A∗ 表示共轭转置,在实数情形就是转置。

最优解总存在:有限维列空间是闭子空间,因此正交投影 p=Pcol(A)b 存在,再取任意满足 Ax⋆=p 的参数即可。解唯一当且仅当 ker⁡A={0},也就是 A 满列秩;一般解集为 x⋆+ker⁡A,这里使用的是线性映射的核。

正交性为何给出最小值,可以直接展开平方验证。对任意增量 h,若 A∗(Ax⋆−b)=0,则

‖A(x⋆+h)−b‖22=‖Ax⋆−b‖22+‖Ah‖22,

交叉项因正交而消失,所以 x⋆ 最优。反过来,若残差不与某个 Ah 正交,沿 h 或 ih 的适当小步移动会降低目标值,矛盾。

直觉

矩阵 A 的各列张成了所有可能的拟合向量 Ax。当 b 落在这个空间之外时,最小二乘在其中寻找离 b 最近的点;从最近点连向 b 的误差方向与整个列空间垂直。正规方程把“残差与每一列都正交”同时写成了一个矩阵等式。

几何上的最近点 Ax⋆ 总唯一,但参数 x⋆ 未必唯一。若 A 有零空间,沿零空间移动不会改变拟合向量,也不会改变残差。把预测唯一与参数唯一分开,是理解秩亏最小二乘的关键。

最小二乘与正规方程示意图
例子与边界

用直线 y=α+βt 拟合三点 (0,1),(1,2),(2,2)。令

A=(101112),b=(122).

正规方程为

(3335)(αβ)=(56),

解得 α=7/6、β=1/2。此时 Ax⋆−b=(1/6,−1/3,1/6)T;其分量和为零,与第一列正交,加权和 0⋅(1/6)+1⋅(−1/3)+2⋅(1/6)=0,也与第二列正交。

A∗A 不总可逆。若 A=(1111)、b=(1,1)T,所有满足 x1+x2=1 的参数都给出零残差,正规方程有无穷多解。最小二乘最小化的是残差 ‖Ax−b‖,不是参数范数;只有另加“在所有最优解中取最小范数”时,Moore–Penrose 伪逆 A+b 才选出唯一参数。

推论与应用

当 A 满列秩时,x∗A∗Ax=‖Ax‖22 说明 A∗A 正定,正规方程给出

x⋆=(A∗A)−1A∗b.

这个公式适合描述解的结构。数值计算中,对至少有一列的满列秩矩阵,显式形成 A∗A 会将二范数条件数平方:κ2(A∗A)=κ2(A)2,从而增加求解对舍入误差的敏感程度。QR 与 SVD 求解方法直接处理 A,避免先构造这个乘积。

QR 用正交列描述同一个列空间,再求解一个三角系统;Gram–Schmidt 过程展示了这些正交列如何构造。

在精确算术中保留全部正奇异值时,奇异值分解还可在秩亏或欠定情形选出原问题的最小范数最优解。若数值实现把实际为正的小奇异值截去,得到的是截断矩阵的最小二乘解,一般不再最小化原矩阵的残差;阈值及其改变的模型必须另外说明。线性回归、信号重建和离散数据拟合都使用这一“先找最近拟合向量,再确定参数”的几何关系。

参考资料
  • Gilbert Strang, MIT 18.06 Linear Algebra, lectures on projections and least squares, accessed 2026.
  • Gene H. Golub and Charles F. Van Loan, Matrix Computations, 4th ed., Johns Hopkins University Press, 2013, Chapter 5.
关系图谱25 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系