Skip to content

Hessian 矩阵

Hessian matrix · Hessian

标量函数二阶 Fréchet 导数在坐标中的矩阵表示,用于描述局部曲率与二次近似。

形式陈述

URn 为开集,f:URxU 的邻域内二阶可微。二阶 Fréchet 导数

D2f(x):Rn×RnR

是连续双线性映射。它在标准基下的矩阵表示称为 fx 的 Hessian:

2f(x)=Hf(x)=[2fxixj(x)]i,j=1n.

采用列梯度约定时,Hessian 也是梯度映射的Jacobian

Hf(x)=Jf(x).

对方向 h,kRn,双线性形式与矩阵对应为

D2f(x)[h,k]=hTHf(x)k.

fC2(U),Schwarz–Clairaut 定理保证混合偏导交换,故 Hf(x) 是实对称矩阵。更弱地,只要相关混合偏导在点附近存在并在该点连续,也可得到对应条目相等。

二阶 Taylor 展开给出 Hessian 的局部模型意义。若 fx 二阶 Fréchet 可微,则当 h0

f(x+h)=f(x)+f(x)Th+12hTHf(x)h+o(h2).

这一定义同时控制所有方向;仅列出坐标轴方向的二阶偏导,不能自动得到统一的 o(h2) 余项。

直觉

梯度描述局部斜坡,Hessian 描述斜坡本身如何随方向变化。二次型 hTHh 是沿方向 h 的二阶弯曲率:正值表示该方向向上弯,负值表示向下弯,零值则需要更高阶项才能判断。

Hessian 的非对角条目记录变量之间的耦合。如果 ijf 很大,改变 xj 会显著改变沿 xi 的斜率。把 Hessian 只看成一串“二阶偏导”会掩盖它作为坐标无关双线性形式的作用;换坐标后矩阵改变,二阶局部几何由相应的合同变换保留。

例子与计算

f(x,y)=x2+2xy+3y24x.

f(x,y)=(2x+2y42x+6y),Hf=(2226).

Hessian 的主子式为 2>0、行列式为 8>0,所以它正定。解 f=0 得唯一驻点 (3,1),并且对任意非零 h 都有 hTHfh>0,故该点是严格全局极小点。因为 f 本身就是二次函数,Taylor 二次模型在这里没有余项。

鞍点例子 g(x,y)=x2y2 的 Hessian 为

Hg=(2002).

在原点梯度为零,但沿 x 轴函数增大、沿 y 轴函数减小,Hessian 的正负特征值准确揭示了鞍形。

对复合 f(x)=ϕ(Ax+b),若 ϕ:RmR 二阶可微,则

2f(x)=AT2ϕ(Ax+b)A.

这个公式说明线性特征映射如何把输出空间的曲率拉回输入空间。

边界与失败情形

二阶偏导在一点都存在,不保证 Hessian 对称。定义

f(x,y)={xy(x2y2)x2+y2,(x,y)(0,0),0,(x,y)=(0,0),

可算得 fxy(0,0)=1fyx(0,0)=1。混合偏导缺少邻域连续性,Clairaut 定理的正则性条件没有满足。此时把条目强行对称化会改变实际的迭代偏导信息,也不能声称存在对称的二阶 Fréchet 导数。

驻点处 Hessian 半正定只给必要条件,不一定给严格极小。例如 f(x)=x4 在零点有 f(0)=0f(0)=0,零点仍是严格极小;而 g(x)=x3 同样有前两阶导数为零,却不是极值。Hessian 退化时必须考察高阶项或其他结构。

在非驻点处,正定 Hessian表示局部凸曲率,却不能把该点称为极小点,因为一阶线性项仍主导下降方向。全局凸性也需要在凸域内每一点 Hessian 半正定,而不是只检查一个位置。

Hessian 依赖坐标和度量。一般流形上,直接对坐标偏导再求偏导不会按张量规律变换,需要联络定义协变 Hessian;本页限于 Euclidean 空间的标准坐标结构。

推论与应用

f(x)=0Hf(x) 正定,则 x 是严格局部极小;若负定则为严格局部极大;若同时有正负方向则为鞍点。这个二阶判别来自 Taylor 展开,而不是矩阵符号本身的孤立规则。

Newton 法求解驻点时使用

Hf(xk)sk=f(xk),

并令 xk+1=xk+sk。信赖域方法则在受限半径内最小化二次模型,允许 Hessian 不定或模型只在局部可靠。实际大规模计算常用 Hessian—向量积 Hf(x)v,无需显式存储整个 n×n 矩阵。

参考资料
  • Walter Rudin, Principles of Mathematical Analysis, 3rd ed., McGraw-Hill, 1976,Ch. 9。
  • Michael Spivak, Calculus on Manifolds, Westview Press, 1965,Ch. 2。
  • Jorge Nocedal and Stephen J. Wright, Numerical Optimization, 2nd ed., Springer, 2006,Ch. 2–4。