形式陈述
本条是一般 Fréchet 可微性 理路 Fréchet 可微性 Differentiability · Fréchet differentiability 赋范空间之间的映射在一点能被单一有界线性主部一致逼近的性质。 在有限维 Euclidean 空间中的坐标化特例。设开集 U ⊆ R n 、映射 f : U → R m ,并假设 f 在 a ∈ U 处 Fréchet 可微。一般定义给出的唯一线性映射 理路 线性映射 Linear map · Linear transformation 保持向量加法和标量乘法的函数。
D f ( a ) : R n → R m 称为多元导数或全微分。它把输入增量送到输出的一阶变化。
在定义域、陪域的标准基下,D f ( a ) 的矩阵是 Jacobian 矩阵 理路 Jacobian 矩阵 Jacobian matrix 多元映射各偏导数组成并表示其导数的矩阵。
J f ( a ) = ( ∂ f i ∂ x j ( a ) ) 1 ≤ i ≤ m 1 ≤ j ≤ n . 第 j 列是 D f ( a ) e j ,也就是各分量对 x j 的偏导数组成的向量。对任意方向 v ∈ R n ,方向导数
D v f ( a ) := lim t → 0 f ( a + t v ) − f ( a ) t = D f ( a ) v = J f ( a ) v 存在并由同一个线性映射给出。
当 m = 1 时,Euclidean 内积把线性泛函 D f ( a ) 唯一表示为梯度:
D f ( a ) h = ∇ f ( a ) ⋅ h , ∇ f ( a ) = ( ∂ f ∂ x 1 ( a ) , … , ∂ f ∂ x n ( a ) ) . 因此 Fréchet 可微蕴含连续、全部偏导存在、全部方向导数存在且关于方向 v 线性。反向一般不成立:即使偏导或所有方向导数存在,也未必能拼成统一的 D f ( a ) 。若各偏导在 a 的某个邻域内存在并在 a 连续,则可推出 f 在 a 可微,此时 Jacobian 才确实代表全微分。
直觉
在一点附近放大函数图像,线性主部描述逐渐显现的仿射近似。Jacobian 的每列记录一个坐标方向引起的输出变化;将它们按位移 h 的坐标加权相加,就得到 D f ( a ) h 。因此一个矩阵可以同时预测任意方向的一阶变化。
导数、Jacobian 与梯度的层次
D f ( a ) 是从输入增量到输出一阶变化的线性映射。Jacobian 是选择定义域与陪域基之后的矩阵;换基会改变条目,却仍表示同一个 D f ( a ) 。在固定的坐标系中,矩阵乘向量就是这一映射的计算方式。
当输出为实数时,D f ( a ) 是线性泛函。选定 Euclidean 内积后,Riesz 表示把它写成向量 ∇ f ( a ) ;若把内积改为 ⟨ u , v ⟩ G = u ⊤ G v ,表示同一泛函的梯度会变为 G − 1 ∇ f ( a ) 。导数没有改变,改变的是用哪个向量代表它。这一点在自然梯度、流形优化和条件数分析中尤其重要。
例子与边界
取 f : R 2 → R 2 ,
f ( x , y ) = ( x 2 y , sin x + y ) . 在点 ( x , y ) ,导数是线性映射
D f ( x , y ) ( h 1 , h 2 ) = ( 2 x y h 1 + x 2 h 2 , cos x h 1 + h 2 ) , 其标准基下的 Jacobian 为
J f ( x , y ) = ( 2 x y x 2 cos x 1 ) . 第一个式子直接给出输入增量的像,第二个式子把同一规则按标准坐标排列。本例的各偏导连续,因此满足可微性的充分条件。
连续偏导的作用可以从沿坐标轴逐步移动看出。把 f ( a + h ) − f ( a ) 拆成每次只改变一个坐标的增量,再对每个输出分量逐段应用一元中值定理 理路 中值定理 Mean value theorem 由等高端点与内部极值导出平均变化率,区分 Lagrange、Rolle、Cauchy 版本并给出可计算的增量界。 ;偏导在 a 的连续性使这些系数统一接近 J f ( a ) 的相应条目,剩余误差便是 o ( ‖ h ‖ ) 。
所有方向导数存在也可能缺少线性相容性。取
f ( x , y ) = { x 3 x 2 + y 2 , ( x , y ) ≠ ( 0 , 0 ) , 0 , ( x , y ) = ( 0 , 0 ) , 沿单位方向 v = ( cos θ , sin θ ) 有 f ( t v ) / t = cos 3 θ ,故原点处所有方向导数都存在;但 v ↦ cos 3 θ 不是 v 的线性函数,因此 f 在原点不可微。这个反例揭示了核心缺口:逐方向极限必须拼成统一线性映射,才可能成为全微分。
导数在邻域中的变化也很关键。令 g ( 0 ) = 0 ,g ( x ) = x + 2 x 2 sin ( 1 / x ) (x ≠ 0 ),则 g ′ ( 0 ) = 1 ,但 g ′ ( x ) = 1 + 4 x sin ( 1 / x ) − 2 cos ( 1 / x ) 在任意零点邻域内都有正值和负值。连续的一元单射必须严格单调,而这些导数符号排除了两种单调性,所以 g 在任何零点邻域都不可逆。
有限维空间中所有范数等价,因此更换范数不改变可微性;无限维中则以选定的赋范结构 理路 赋范向量空间 Normed vector space 带满足正定、齐次与三角不等式范数的向量空间。 衡量余项,不等价的范数可以改变收敛及可微性质。
推论与应用
链式法则 理路 链式法则 Chain rule 复合映射的导数等于各层导数按计算顺序组成的线性映射复合。 在此框架下就是线性映射的复合:若 f 在 a 可微、g 在 f ( a ) 可微,则
D ( g ∘ f ) ( a ) = D g ( f ( a ) ) ∘ D f ( a ) , 对应 Jacobian 矩阵相乘。特殊情形各有名字:m = 1 时 D f ( a ) 由梯度 理路 梯度 Gradient 标量函数微分在内积下对应的向量。 经内积表示;n = 1 时它给出曲线的速度向量。
标准 C 1 反函数定理 理路 逆函数定理 Inverse function theorem 导数可逆的光滑映射在该点邻域内存在光滑局部逆。 要求 m = n 、f 在 a 的开邻域连续可微,且 D f ( a ) 可逆。它据此给出邻域上的 C 1 逆映射,并满足 D ( f − 1 ) ( f ( a ) ) = ( D f ( a ) ) − 1 。导数连续性把一点的可逆线性近似连接到附近的非线性映射。
隐函数定理 理路 隐函数定理 Implicit function theorem 当相关偏导块可逆时,方程组局部可把部分变量表示为其余变量的函数。 则针对约束 F ( x , y ) = 0 :在 C 1 条件下,若对待解变量 y 的导数块可逆,就能在局部把 y 表示为 x 的函数。所选导数块对应要解出的变量。
在数值分析中,‖ D f ( a ) ‖ 衡量单位输入位移的一阶最大输出,是问题条件性 理路 问题条件性与条件数 Conditioning of a problem · Condition number 度量问题真解对输入微扰的局部敏感性,并把这种固有敏感性与算法误差分开。 的局部量。若 f 在凸区域内处处可微且导数范数统一有界,则可沿线段应用一元中值估计,将这个统一界转为区域上的 Lipschitz 界。
标量函数的二阶 Fréchet 导数由Hessian 矩阵 理路 Hessian 矩阵 Hessian matrix · Hessian 标量函数二阶 Fréchet 导数在坐标中的矩阵表示,用于描述局部曲率与二次近似。 表示,把多元 Taylor 展开的二次项与局部曲率集中到一个双线性形式中。二阶偏导只有在适当正则性下才可交换。
优化中的一阶必要条件 ∇ f ( a ) = 0 、Newton 法 理路 Newton 非线性方程法 Newton's method · Newton-Raphson method · Newton method for nonlinear systems 在当前点解一阶线性化方程来修正非线性方程的近似解,并分析其局部二次收敛与失效边界。 的线性化步骤都直接使用本定义;把定义域从开集换成流形,导数升级为切空间 理路 切空间 Tangent space 在一点由曲线速度或函数导子等价定义的局部线性空间。 之间的切映射,符号仍是同一个 D f 。
参考资料
Janko Gravner, Notes on inverse functions , UC Davis, Math 125B, Winter 2015,Theorem 1;邻域正则性。
Walter Rudin, Principles of Mathematical Analysis, 3rd ed., McGraw-Hill, 1976,Ch. 9, differentiation of maps between Euclidean spaces。
Michael Spivak, Calculus on Manifolds, W. A. Benjamin, 1965,Ch. 2, derivative as a linear transformation and the chain rule。