Skip to content

梯度

Gradient

标量函数微分在内积下对应的向量。

条目类型
定义

形式陈述

V 为有限维实内积空间,f:UVR 在点 a 可微。由有限维 Riesz 表示,存在唯一向量 f(a) 使

Df(a)[h]=f(a),h对所有 hV.

在标准欧氏坐标中,

f(a)=(fx1(a),,fxn(a)).

单位方向 u 的方向导数为 Duf(a)=f(a),u。由Cauchy–Schwarz 不等式,其最大值为 f(a),在梯度非零时由 u=f(a)/f(a) 取得。

直觉

梯度不是微分本身,而是借助内积把线性泛函表示成向量后的结果。单位方向 v 上的方向导数是 f,v,所以内积的对齐界表明梯度方向给出该度量下最快上升。换一把尺子会改变“最快”的方向,正因梯度包含度量选择。

例子与边界

f(x,y)=x2+3y2f=(2x,6y),等值线的切向量与梯度正交。梯度为零只是无约束局部极值的必要条件,不是充分条件:f(x,y)=x2y2 在原点梯度为零却是鞍点。换用加权内积 x,yM=xTMy 时,同一微分对应的梯度变为 M1Euclidf。在无限维空间中,并非每个线性泛函都由内积向量表示,需 Hilbert 结构与连续性。

f(x,y)=x2+4xy+5y2

f=(2x+4y,4x+10y).

在点 (1,0),单位方向 v=(0,1) 的方向导数为 4;沿梯度归一化方向则达到最大值 f(1,0)=20。若只求两个偏导而忽略所用坐标基和内积,在流形或非正交坐标中会得到错误的“梯度向量”。

推论与应用

多元微分先产生协向量,内积空间再把它识别为梯度。凸优化利用梯度的支撑不等式判断全局最优,切空间上的 Riemann 度量则把同一构造推广到流形。预条件和自然梯度本质上都是更换内积后重新解释最速方向。

统计似然把参数视为坐标时,score 是 log likelihood 对参数的梯度,其期望为零与信息等式依赖交换微分、积分等正则性;Hessian记录二阶局部曲率。它们属于具体统计模型的推断接口,不能从一般梯度公理直接推出估计一致或检验有效。

约束极值把梯度投影到允许方向,在线梯度下降则在每轮损失揭示后走负梯度或次梯度步,并用到比较器的距离控制 regret。梯度 boosting是在函数空间中沿经验损失的负梯度方向逐步加入基学习器;这里的“梯度”仍依赖所选函数表示与内积,并不把它变成分类风险的直接保证。无论静态还是在线,梯度为零只是一阶驻点信息,不能说明样本外泛化。

势场与 PDE 把梯度解释为空间变化的驱动力;在 Riemann 流形上连续沿负梯度运动,便得到依赖所选度量的梯度流。

参考资料
  • Walter Rudin, Principles of Mathematical Analysis, 3rd ed., McGraw-Hill, 1976,Ch. 9, differentials of scalar functions。
  • Michael Spivak, Calculus on Manifolds, W. A. Benjamin, 1965,Ch. 2, derivatives, inner products, and directional derivatives。
关系图谱36 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系