形式陈述
本条是一般 Fréchet 可微性 公理库 Fréchet 可微性 Differentiability · Fréchet differentiability 赋范空间之间的映射在一点能被单一有界线性主部一致逼近的性质。 在有限维 Euclidean 空间中的坐标化特例。设开集 U ⊆ R n 、映射 f : U → R m ,并假设 f 在 a ∈ U 处 Fréchet 可微。一般定义给出的唯一线性映射 公理库 线性映射 Linear map · Linear transformation 保持向量加法和标量乘法的函数。
D f ( a ) : R n → R m 称为多元导数或全微分;“全微分”不是另一份逐坐标数据,而是同一个坐标无关的线性主部。
在定义域、陪域的标准基下,D f ( a ) 的矩阵是 Jacobian 矩阵 公理库 Jacobian 矩阵 Jacobian matrix 多元映射各偏导数组成并表示其导数的矩阵。
J f ( a ) = ( ∂ f i ∂ x j ( a ) ) 1 ≤ i ≤ m 1 ≤ j ≤ n . 第 j 列是 D f ( a ) e j ,也就是各分量对 x j 的偏导数组成的向量。对任意方向 v ∈ R n ,方向导数
D v f ( a ) := lim t → 0 f ( a + t v ) − f ( a ) t = D f ( a ) v = J f ( a ) v 存在并由同一个线性映射给出。
当 m = 1 时,Euclidean 内积把线性泛函 D f ( a ) 唯一表示为梯度:
D f ( a ) h = ∇ f ( a ) ⋅ h , ∇ f ( a ) = ( ∂ f ∂ x 1 ( a ) , … , ∂ f ∂ x n ( a ) ) . 因此 Fréchet 可微蕴含连续、全部偏导存在、全部方向导数存在且关于方向 v 线性。反向一般不成立:即使偏导或所有方向导数存在,也未必能拼成统一的 D f ( a ) 。若各偏导在 a 的某个邻域内存在并在 a 连续,则可推出 f 在 a 可微,此时 Jacobian 才确实代表全微分。
直觉
一般的 Fréchet 可微性 公理库 Fréchet 可微性 Differentiability · Fréchet differentiability 赋范空间之间的映射在一点能被单一有界线性主部一致逼近的性质。 要求一个线性映射统一控制局部误差;本条只把它放进有限维 Euclidean 坐标。在 a 附近不断放大,f 的图像越来越接近由 D f ( a ) 决定的仿射平面。偏导数只沿坐标轴探测函数,而全微分要求同一个线性映射同时预测所有方向。正因如此,复合与求逆在导数层面变成线性映射的复合与矩阵乘法。
导数、Jacobian 与梯度的层次
D f ( a ) 是从输入增量到输出一阶变化的线性映射,不依赖坐标。Jacobian 是选择定义域与陪域基之后的矩阵;换基会改变矩阵条目,却不会改变 D f ( a ) 。因此矩阵计算必须保留基的约定,不能把某一张 Jacobian 当成坐标无关对象。
当输出为实数时,D f ( a ) 是线性泛函。选定 Euclidean 内积后,Riesz 表示把它写成向量 ∇ f ( a ) ;若把内积改为 ⟨ u , v ⟩ G = u ⊤ G v ,表示同一泛函的梯度会变为 G − 1 ∇ f ( a ) 。导数没有改变,改变的是用哪个向量代表它。这一点在自然梯度、流形优化和条件数分析中尤其重要。
例子与边界
取 f : R 2 → R 2 ,
f ( x , y ) = ( x 2 y , sin x + y ) . 在点 ( x , y ) ,导数是线性映射
D f ( x , y ) ( h 1 , h 2 ) = ( 2 x y h 1 + x 2 h 2 , cos x h 1 + h 2 ) , 其标准基下的 Jacobian 为
J f ( x , y ) = ( 2 x y x 2 cos x 1 ) . 这两个式子描述同一个导数:前者是线性映射,后者是选定坐标后的矩阵。若各偏导数在某邻域存在并在考察点连续,则可推出 Fréchet 可微;“所有偏导存在”本身仍不够。
连续偏导为何足够,可以从坐标方向逐步移动看出。把 f ( a + h ) − f ( a ) 拆成每次只改变一个坐标的增量,再对每段应用一元中值定理;偏导在 a 附近的连续性使这些系数统一接近 J f ( a ) 的相应列,剩余误差便是 o ( ‖ h ‖ ) 。这个论证控制所有方向,而不是分别验证若干坐标轴。
反方向的蕴含全部失效,且失效得很彻底。取
f ( x , y ) = { x 3 x 2 + y 2 , ( x , y ) ≠ ( 0 , 0 ) , 0 , ( x , y ) = ( 0 , 0 ) , 沿单位方向 v = ( cos θ , sin θ ) 有 f ( t v ) / t = cos 3 θ ,故原点处所有方向导数都存在;但 v ↦ cos 3 θ 不是 v 的线性函数,因此 f 在原点不可微。这个反例揭示了核心缺口:逐方向极限必须拼成统一线性映射,才可能成为全微分。
定义中出现的范数在有限维上可任意选取,因为所有范数等价。到无限维空间则必须先指定赋范结构 公理库 赋范向量空间 Normed vector space 带满足正定、齐次与三角不等式范数的向量空间。 ;换范数可能改变映射是否可微。
推论与应用
链式法则 公理库 链式法则 Chain rule 复合映射的导数等于各层导数按计算顺序组成的线性映射复合。 在此框架下就是线性映射的复合:若 f 在 a 可微、g 在 f ( a ) 可微,则
D ( g ∘ f ) ( a ) = D g ( f ( a ) ) ∘ D f ( a ) , 对应 Jacobian 矩阵相乘。特殊情形各有名字:m = 1 时 D f ( a ) 由梯度 公理库 梯度 Gradient 标量函数微分在内积下对应的向量。 经内积表示;n = 1 时它给出曲线的速度向量。当 D f ( a ) 可逆时,反函数定理 公理库 逆函数定理 Inverse function theorem 导数可逆的光滑映射在该点邻域内存在光滑局部逆。 保证 f 局部可逆,隐函数定理 公理库 隐函数定理 Implicit function theorem 当相关偏导块可逆时,方程组局部可把部分变量表示为其余变量的函数。 则从满秩条件解出隐式约束——两者都是"线性化性质提升为局部非线性性质"的范式。
矩阵乘法的顺序也由复合顺序决定:先作用 D f ( a ) ,再作用 D g ( f ( a ) ) 。把两个 Jacobian 反过来相乘不仅可能形状不匹配,即使都是方阵,也会表达另一种线性变换。
在数值分析中,‖ D f ( a ) ‖ 描述给定范数下的一阶局部敏感性,是问题条件性 公理库 问题条件性与条件数 Conditioning of a problem · Condition number 度量问题真解对输入微扰的局部敏感性,并把这种固有敏感性与算法误差分开。 的线性化入口,但它不等于跨越整个区域的 Lipschitz 常数。
标量函数的二阶 Fréchet 导数由Hessian 矩阵 公理库 Hessian 矩阵 Hessian matrix · Hessian 标量函数二阶 Fréchet 导数在坐标中的矩阵表示,用于描述局部曲率与二次近似。 表示,把多元 Taylor 展开的二次项与局部曲率集中到一个双线性形式中。二阶偏导只有在适当正则性下才可交换。
优化中的一阶必要条件 ∇ f ( a ) = 0 、Newton 法 公理库 Newton 非线性方程法 Newton's method · Newton-Raphson method · Newton method for nonlinear systems 在当前点解一阶线性化方程来修正非线性方程的近似解,并分析其局部二次收敛与失效边界。 的线性化步骤都直接使用本定义;把定义域从开集换成流形,导数升级为切空间 公理库 切空间 Tangent space 在一点由曲线速度或函数导子等价定义的局部线性空间。 之间的切映射,符号仍是同一个 D f 。
参考资料
Walter Rudin, Principles of Mathematical Analysis, 3rd ed., McGraw-Hill, 1976,Ch. 9, differentiation of maps between Euclidean spaces。
Michael Spivak, Calculus on Manifolds, W. A. Benjamin, 1965,Ch. 2, derivative as a linear transformation and the chain rule。