卷二 · 数学之美15 分钟阅读

函数导数九:映射微分和复合求导

设开集D⊂RnD \subset \mathbb{R}^n,f:D→Rm\boldsymbol{f}: D \to \mathbb{R}^m。记f\boldsymbol{f}的分量依次为f1,f2,⋯ ,fmf_1,f_2,\cdots,f_m,可以把f(x)\boldsymbol{f}(\boldsymbol{x})写成

f(x)=(f1(x)f2(x)⋮fm(x))(x∈D) \boldsymbol{f(x)} = \left( \begin{matrix} f_1(\boldsymbol{x}) \\ f_2(\boldsymbol{x}) \\ \vdots \\ f_m(\boldsymbol{x}) \end{matrix} \right) \quad (\boldsymbol{x} \in D)

设点x0∈D,h∈Rn\boldsymbol{x}_0 \in D, \boldsymbol{h} \in \mathbb{R}^n。由于x0\boldsymbol{x}_0是DD的内点,所以总可以找到充分小的∥h∥\Vert \boldsymbol{h} \Vert使得x0+h∈D\boldsymbol{x}_0 + \boldsymbol{h} \in D。

定义1

如果映射f\boldsymbol{f}满足

f(x0+h)−f(x0)=Ah+r(h) \boldsymbol{f}(\boldsymbol{x}_0 + \boldsymbol{h}) - \boldsymbol{f}(\boldsymbol{x}_0) = \boldsymbol{Ah} + \boldsymbol{r}(\boldsymbol{h})

式中A\boldsymbol{A}是一个m×nm \times n矩阵,它的元素不依赖于h\boldsymbol{h},且
lim⁡h→0∥r(h)∥∥h∥=0 \lim \limits_{\boldsymbol{h} \to \boldsymbol{0}} \frac{\Vert \boldsymbol{r}(\boldsymbol{h}) \Vert}{\Vert \boldsymbol{h} \Vert} = 0

则称映射f\boldsymbol{f}在点x0\boldsymbol{x}_0处可微,并称Ah\boldsymbol{Ah}是f\boldsymbol{f}在点x0\boldsymbol{x}_0处的微分,记作
df(x0)=Ah \mathrm{d}\boldsymbol{f}(\boldsymbol{x}_0) = \boldsymbol{Ah}

定理1

若映射f\boldsymbol{f}在点x0\boldsymbol{x}_0处可微,则有

df(x0)=Jf(x0)h \mathrm{d}\boldsymbol{f}(\boldsymbol{x}_0) = \boldsymbol{Jf}(\boldsymbol{x}_0)\boldsymbol{h}

其中
Jf(x0)=[∂f1(x0)∂x1⋯∂f1(x0)∂xn⋮⋮∂fm(x0)∂x1⋯∂fm(x0)∂xn] \boldsymbol{Jf}(\boldsymbol{x}_0) = \left[ \begin{matrix} \frac{\partial f_1(\boldsymbol{x}_0)}{\partial x_1} & \cdots & \frac{\partial f_1(\boldsymbol{x}_0)}{\partial x_n} \\ \vdots & & \vdots \\ \frac{\partial f_m(\boldsymbol{x}_0)}{\partial x_1} & \cdots & \frac{\partial f_m(\boldsymbol{x}_0)}{\partial x_n} \end{matrix} \right]

称之为映射f\boldsymbol{f}在点x0\boldsymbol{x}_0处的Jacobi矩阵,也称为导数。

证:有定义可知,

f(x0+h)−f(x0)=Ah+r(h) \boldsymbol{f}(\boldsymbol{x}_0 + \boldsymbol{h}) - \boldsymbol{f}(\boldsymbol{x}_0) = \boldsymbol{Ah} + \boldsymbol{r}(\boldsymbol{h})

设
A=[a11⋯a1n⋮⋮am1⋯amn] \boldsymbol{A} = \left[\begin{matrix} a_{11} & \cdots & a_{1n} \\ \vdots & & \vdots \\ a_{m1} & \cdots & a_{mn} \end{matrix}\right]

将其代入上式中得
fi(x0+h)−fi(x0)=∑j=1naijhj+ri(h) f_i(\boldsymbol{x}_0 + \boldsymbol{h}) - f_i(\boldsymbol{x}_0) = \sum_{j=1}^n a_{ij} h_j + r_i(\boldsymbol{h})

其中ri(h)r_i(\boldsymbol{h})表示r(h)\boldsymbol{r}(\boldsymbol{h})的第ii个分量,由r(h)\boldsymbol{r}(\boldsymbol{h})的性质可知
ri(h)=o(∥h∥)(h→0,i=1,2,⋯ ,m) r_i(\boldsymbol{h}) = o(\Vert \boldsymbol{h} \Vert) \quad (\boldsymbol{h} \to 0, i=1,2,\cdots,m)

从而继续由函数导数八定理1可知
aij=∂fi(x0)∂xj(i=1,2,⋯ ,m;j=1,2,⋯ ,n) a_{ij} = \frac{\partial f_i(\boldsymbol{x}_0)}{\partial x_j} (i=1,2,\cdots,m;j=1,2,\cdots,n)

从而得证。

Q.E.D.

定理2

若映射f\boldsymbol{f}在点x0\boldsymbol{x}_0的某一邻域内存在Jacobi矩阵Jf\boldsymbol{Jf},且Jf\boldsymbol{Jf}的各元素在x0\boldsymbol{x}_0处都连续,则映射f\boldsymbol{f}在点x0\boldsymbol{x}_0处可微。

证:由定理1与函数导数八的定理2易证。

Q.E.D.

定义2

设开集D⊂RnD \subset \mathbb{R}^n,f:D→Rm\boldsymbol{f}: D \to \mathbb{R}^m。如果f\boldsymbol{f}在DD上的每一点处都连续,则记f∈C(D)\boldsymbol{f} \in C(D);如果Jf\boldsymbol{Jf}在D\boldsymbol{D}上的每一点处都连续,则记f∈C1(D)\boldsymbol{f} \in C^1(D)。

定理3

设开集D⊂RnD \subset \mathbb{R}^n,g:D→Rm\boldsymbol{g}: D \to \mathbb{R}^m,g\boldsymbol{g}在点x0∈D\boldsymbol{x}_0 \in D处可微,又设f\boldsymbol{f}把包含g(D)\boldsymbol{g}(D)的一个开集映射至Rl\mathbb{R}^l,并且f\boldsymbol{f}在g(x0)\boldsymbol{g}(\boldsymbol{x}_0)处可微,那么复合映射f∘g\boldsymbol{f} \circ \boldsymbol{g}在点x0\boldsymbol{x}_0处可微,并且

J(f∘g)(x0)=Jf(g(x0))Jg(x0) \boldsymbol{J}(\boldsymbol{f}\circ \boldsymbol{g})(\boldsymbol{x}_0) = \boldsymbol{Jf}(\boldsymbol{g}(\boldsymbol{x}_0)) \boldsymbol{Jg}(\boldsymbol{x}_0)

证:令y0=g(x0)\boldsymbol{y}_0 = \boldsymbol{g}(\boldsymbol{x}_0),A=Jf(y0),B=Jg(x0)\boldsymbol{A} = \boldsymbol{Jf}(\boldsymbol{y}_0),\boldsymbol{B} = \boldsymbol{Jg}(\boldsymbol{x}_0),易知A\boldsymbol{A}是l×ml\times m矩阵,B\boldsymbol{B}是m×nm \times n矩阵,从而若能证明

lim⁡∥h∥→0∥(f∘g)(x0+h)−(f∘g)(x0)−ABh∥∥h∥=0(1) \lim \limits_{\Vert \boldsymbol{h} \Vert \to 0} \frac{\Vert (\boldsymbol{f} \circ \boldsymbol{g})(\boldsymbol{x}_0 + \boldsymbol{h}) - (\boldsymbol{f} \circ \boldsymbol{g})(\boldsymbol{x}_0) - \boldsymbol{ABh} \Vert}{\Vert \boldsymbol{h} \Vert} = 0 \tag{1}

则由定义1可知,J(f∘g)(x0)=AB\boldsymbol{J}(\boldsymbol{f}\circ \boldsymbol{g})(\boldsymbol{x}_0) = \boldsymbol{AB}。
由于g,f\boldsymbol{g},\boldsymbol{f}分别在x0,y0\boldsymbol{x}_0,\boldsymbol{y}_0处可微,从而有
g(x0+h)−g(x0)=Bh+u(h)f(y0+k)−f(y0)=Ak+v(k)(2) \begin{aligned} \boldsymbol{g}(\boldsymbol{x}_0 + \boldsymbol{h}) - \boldsymbol{g}(\boldsymbol{x}_0) = \boldsymbol{Bh} + \boldsymbol{u}(\boldsymbol{h}) \\ \boldsymbol{f}(\boldsymbol{y}_0 + \boldsymbol{k}) - \boldsymbol{f}(\boldsymbol{y}_0) = \boldsymbol{Ak} + \boldsymbol{v}(\boldsymbol{k}) \end{aligned} \tag{2}

其中h,k\boldsymbol{h},\boldsymbol{k}分别为n×1n \times 1矩阵和m×1m \times 1矩阵,且
∥u(h)∥∥h∥→0(∥h∥→0)∥v(k)∥∥k∥→0(∥k∥→0) \begin{aligned} \frac{\Vert \boldsymbol{u}(\boldsymbol{h}) \Vert}{\Vert \boldsymbol{h} \Vert} \to 0 \quad (\Vert \boldsymbol{h} \Vert \to 0) \\ \frac{\Vert \boldsymbol{v}(\boldsymbol{k}) \Vert}{\Vert \boldsymbol{k} \Vert} \to 0 \quad (\Vert \boldsymbol{k} \Vert \to 0) \end{aligned}

记
∥u(h)∥∥h∥=ε(h),∥v(h)∥∥h∥=η(h) \frac{\Vert \boldsymbol{u}(\boldsymbol{h}) \Vert}{\Vert \boldsymbol{h} \Vert} = \varepsilon(\boldsymbol{h}), \quad \frac{\Vert \boldsymbol{v}(\boldsymbol{h}) \Vert}{\Vert \boldsymbol{h} \Vert} = \eta(\boldsymbol{h})

则
∥u(h)∥=ε(h)∥h∥,∥v(k)∥=η(k)∥k∥ \Vert \boldsymbol{u}(\boldsymbol{h}) \Vert = \varepsilon(\boldsymbol{h}) \Vert \boldsymbol{h} \Vert, \quad \Vert \boldsymbol{v}(\boldsymbol{k}) \Vert = \eta(\boldsymbol{k}) \Vert \boldsymbol{k} \Vert

且
lim⁡∥h∥→0ε(h)=0,lim⁡∥k∥→0η(k)=0(3) \lim \limits_{\Vert \boldsymbol{h} \Vert \to 0} \varepsilon(\boldsymbol{h}) = 0, \quad \lim \limits_{\Vert \boldsymbol{k} \Vert \to 0} \eta(\boldsymbol{k}) = 0 \tag{3}

对给定的h\boldsymbol{h},令k=g(x0+h)−g(x0)\boldsymbol{k} = \boldsymbol{g}(\boldsymbol{x}_0 + \boldsymbol{h}) - \boldsymbol{g}(\boldsymbol{x}_0),由式(2)可得
∥k∥≤∥Bh∥+∥u(h)∥≤(∥B∥+ε(h))∥h∥ \Vert \boldsymbol{k} \Vert \le \Vert \boldsymbol{Bh} \Vert + \Vert \boldsymbol{u}(\boldsymbol{h})\Vert \le (\Vert \boldsymbol{B} \Vert + \varepsilon(\boldsymbol{h})) \Vert \boldsymbol{h} \Vert

从而有
∥f∘g(x0+h)−f∘g(x0)−ABh∥=∥f(g(x0+h))−f(g(x0))−ABh∥=∥f(y0+k)−f(y0)−ABh∥=∥Ak+v(k)−ABh∥=∥A(k−Bh)+vk∥≤∥A∥u(h)+η(k)∥k∥≤∥A∥ε(h)∥h∥+η(k)(∥B∥+ε(h))∥h∥ \begin{aligned} & \Vert \boldsymbol{f} \circ \boldsymbol{g} (\boldsymbol{x}_0 + \boldsymbol{h}) - \boldsymbol{f} \circ \boldsymbol{g} (\boldsymbol{x}_0) - \boldsymbol{ABh} \Vert \\ & = \Vert \boldsymbol{f}(\boldsymbol{g} (\boldsymbol{x}_0 + \boldsymbol{h})) - \boldsymbol{f}(\boldsymbol{g} (\boldsymbol{x}_0)) - \boldsymbol{ABh} \Vert \\ & = \Vert \boldsymbol{f}(\boldsymbol{y}_0 + \boldsymbol{k}) - \boldsymbol{f}(\boldsymbol{y}_0) - \boldsymbol{ABh} \Vert \\ & = \Vert \boldsymbol{Ak} + \boldsymbol{v}(\boldsymbol{k}) - \boldsymbol{ABh} \Vert \\ & = \Vert \boldsymbol{A}(\boldsymbol{k} - \boldsymbol{Bh}) + \boldsymbol{v}{\boldsymbol{k}} \Vert \\ & \le \Vert \boldsymbol{A} \Vert u(\boldsymbol{h}) + \eta(\boldsymbol{k})\Vert \boldsymbol{k} \Vert \\ & \le \Vert \boldsymbol{A} \Vert \varepsilon(\boldsymbol{h}) \Vert \boldsymbol{h} \Vert + \eta(\boldsymbol{k})(\Vert \boldsymbol{B} \Vert + \varepsilon(\boldsymbol{h})) \Vert \boldsymbol{h} \Vert \end{aligned}

所以
∥(f∘g)(x0+h)−(f∘g)(x0)−ABh∥∥h∥≤∥A∥ε(h)+η(k)(∥B∥+ε(h)) \frac{\Vert (\boldsymbol{f} \circ \boldsymbol{g})(\boldsymbol{x}_0 + \boldsymbol{h}) - (\boldsymbol{f} \circ \boldsymbol{g})(\boldsymbol{x}_0) - \boldsymbol{ABh} \Vert}{\Vert \boldsymbol{h} \Vert} \le \Vert \boldsymbol{A} \Vert \varepsilon(\boldsymbol{h}) + \eta(\boldsymbol{k})(\Vert \boldsymbol{B} \Vert + \varepsilon(\boldsymbol{h}))

再由式(3)可知式(1)成立。

Q.E.D.

继续这个系列