“在最优点处,目标梯度不能指向任何可行的一阶下降方向。活跃约束 $f i(x^ )=0$ 的梯度是边界法向量,乘子把这些法向量与等式约束法向量组合起来,恰好抵消目标梯度;不活跃约束还有余量,不…”
形式陈述 ​
设
在标准欧氏坐标中,
单位方向
直觉
梯度不是微分本身,而是借助内积把线性泛函表示成向量后的结果。单位方向
例子与边界
对
对
在点
推论与应用
多元微分先产生协向量,内积空间再把它识别为梯度。凸优化利用梯度的支撑不等式判断全局最优,切空间上的 Riemann 度量则把同一构造推广到流形。预条件和自然梯度本质上都是更换内积后重新解释最速方向。
统计似然把参数视为坐标时,score 是 log likelihood 对参数的梯度,其期望为零与信息等式依赖交换微分、积分等正则性;Hessian记录二阶局部曲率。它们属于具体统计模型的推断接口,不能从一般梯度公理直接推出估计一致或检验有效。
约束极值把梯度投影到允许方向,在线梯度下降则在每轮损失揭示后走负梯度或次梯度步,并用到比较器的距离控制 regret。梯度 boosting是在函数空间中沿经验损失的负梯度方向逐步加入基学习器;这里的“梯度”仍依赖所选函数表示与内积,并不把它变成分类风险的直接保证。无论静态还是在线,梯度为零只是一阶驻点信息,不能说明样本外泛化。
势场与 PDE 把梯度解释为空间变化的驱动力;在 Riemann 流形上连续沿负梯度运动,便得到依赖所选度量的梯度流。
参考资料
- Walter Rudin, Principles of Mathematical Analysis, 3rd ed., McGraw-Hill, 1976,Ch. 9, differentials of scalar functions。
- Michael Spivak, Calculus on Manifolds, W. A. Benjamin, 1965,Ch. 2, derivatives, inner products, and directional derivatives。