卷二 · 数学之美16 分钟阅读

函数导数十三:极值

定义1

设开集D⊂RnD \subset \mathbb{R}^n,函数f:D→Rf: D \to \mathbb{R},点x0∈D\boldsymbol{x}_0 \in D,如果存在一个去心球Br(xˇ0)⊂DB_r(\boldsymbol{\check x}_0) \subset D,使得对任意的x∈Br(xˇ0)\boldsymbol{x} \in B_r(\boldsymbol{\check x}_0),都有f(x)≥f(x0)(f(x)>f(x0))f(\boldsymbol{x}) \ge f(\boldsymbol{x}_0)(f(\boldsymbol{x}) > f(\boldsymbol{x}_0)),那么x0\boldsymbol{x}_0称为ff的一个(严格)极小值点,f(x0)f(\boldsymbol{x}_0)称为函数ff的一个(严格)极小值。同样可以定义(严格)极大值点与(严格)极大值。极小值与极大值统称为极值。

定义2

设开集D⊂RnD \subset \mathbb{R}^n,函数f:D→Rf: D \to \mathbb{R},点x0∈D\boldsymbol{x}_0 \in D,如果∂f∂xi(a)(i=1,2,⋯ ,n)\displaystyle \frac{\partial f}{\partial x_i} (\boldsymbol{a})(i=1,2,\cdots,n)都存在等于00,则称点x0\boldsymbol{x}_0为函数ff的驻点。

定理1

设nn元函数ff在a=(a1,⋯ ,an)\boldsymbol{a} = (a_1,\cdots,a_n)处取得极值,且∂f∂xi(a)(i=1,2,⋯ ,n)\displaystyle \frac{\partial f}{\partial x_i}(\boldsymbol{a})(i=1,2,\cdots,n)都存在,那么a\boldsymbol{a}必定是ff的驻点。

证:不妨设ff在a\boldsymbol{a}处取得极小值,那么存在球Br(a)B_{r}(\boldsymbol{a}),使得对任意的x∈Br(a)\boldsymbol{x} \in B_{\boldsymbol{r}}(\boldsymbol{a}),有

f(x)≥f(a) f(\boldsymbol{x}) \ge f(\boldsymbol{a})

考虑单变量tt的函数
φ(t)=f(a1,⋯ ,at−1,t,at+1,⋯ ,an) \varphi(t) = f(a_1,\cdots,a_{t-1},t,a_{t+1},\cdots,a_n)

让tt满足∣t−ai∣<r|t - a_i| < r,取x=(a1,⋯ ,at−1,t,at+1,⋯ ,an)\boldsymbol{x} = (a_1,\cdots,a_{t-1},t,a_{t+1},\cdots,a_n),可知∥x−a∥=∣t−ai∣<r\Vert \boldsymbol{x} - \boldsymbol{a}\Vert = |t - a_i| < r,即x∈Br(a)\boldsymbol{x} \in B_{\boldsymbol{r}}(\boldsymbol{a}),所以有f(x)≥f(a)f(\boldsymbol{x}) \ge f(\boldsymbol{a}),即φ(t)≥φ(ai)\varphi(t) \ge \varphi(a_i),从而φ\varphi在aia_i处取得极小值,所以有φ′(ai)=0\varphi^\prime(a_i) = 0,即∂f∂xi(a)=0\displaystyle \frac{\partial f}{\partial x_i} (\boldsymbol{a}) = 0。

Q.E.D.

定理2

设x0\boldsymbol{x}_0是nn元函数ff的一个驻点,函数ff在x0\boldsymbol{x}_0的某一邻域内有连续的二阶偏导数,
(1)如果Hesse方阵Hf(x0)Hf(\boldsymbol{x}_0)是严格正(负)定方阵,那么x0\boldsymbol{x}_0是ff的一个严格极小(大)值点。
(2)如果Hesse方阵Hf(x0)Hf(\boldsymbol{x}_0)是不定方阵,那么x0\boldsymbol{x}_0不是ff的极值点。

证:(1)设Hf(x0)Hf(\boldsymbol{x}_0)是严格正定方阵,由于ff在x0\boldsymbol{x}_0的某一邻域内有连续的二阶偏导数,从而由函数导数十二的定理5可知

f(x0+h)=f(x0)+Jf(x0)h+12hTHf(x0)h+o(∥h∥2)(h→0) f(\boldsymbol{x}_0 + \boldsymbol{h}) = f(\boldsymbol{x}_0) + Jf(\boldsymbol{x}_0)\boldsymbol{h} + \frac{1}{2}\boldsymbol{h}^T Hf(\boldsymbol{x}_0) \boldsymbol{h} + o(\Vert \boldsymbol{h} \Vert^2) \quad (\boldsymbol{h} \to \boldsymbol{0})

又因为x0\boldsymbol{x}_0是ff的驻点,从而上式可写为
f(x0+h)−f(x0)=12hTHf(x0)h+o(∥h∥2)(1) f(\boldsymbol{x}_0 + \boldsymbol{h}) - f(\boldsymbol{x}_0) = \frac{1}{2} \boldsymbol{h}^T Hf(\boldsymbol{x}_0) \boldsymbol{h} + o(\Vert \boldsymbol{h} \Vert^2) \tag {1}

设∥y∥=1\Vert \boldsymbol{y} \Vert = 1,它的全体是单位球的球面∂B1(0)\partial B_1(\boldsymbol{0}),因为Hf(x0)Hf(\boldsymbol{x}_0)是严格正定的,所以
(y1,⋯ ,yn)Hf(x0)[y1⋮ym]=∑i,j=1n∂2f∂xi∂xj(x0)yiyj>0 (y_1,\cdots,y_n) Hf(\boldsymbol{x}_0) \begin{bmatrix} y_1 \\ \vdots \\ y_m \end{bmatrix} = \sum_{i,j=1}^n \frac{\partial^2 f}{\partial x_i \partial x_j}(\boldsymbol{x}_0) y_iy_j > 0

这时单位球面上的连续函数,而单位球面是一个有界闭集,从而它在单位球面上某点取得最小值,设此最小值为m>0m>0,从而有
ytHf(x0)y≥m>0 \boldsymbol{y}^t Hf(\boldsymbol{x}_0) \boldsymbol{y} \ge m > 0

而
12hTHf(x0)h=12∥h∥2(hT∥h∥Hf(x0)h∥h∥)≥m2∥h∥2 \frac{1}{2} \boldsymbol{h}^T Hf(\boldsymbol{x}_0) \boldsymbol{h} = \frac{1}{2} \Vert \boldsymbol{h} \Vert^2 \left( \frac{\boldsymbol{h}^T}{\Vert \boldsymbol{h}\Vert} Hf(\boldsymbol{x}_0) \frac{\boldsymbol{h}}{\Vert \boldsymbol{h} \Vert}\right) \ge \frac{m}{2} \Vert \boldsymbol{h} \Vert^2

将其代入(1)式中,得
f(x0+h)−f(x0)=∥h∥2(m2+o(1))>0 f(\boldsymbol{x}_0 + \boldsymbol{h}) - f(\boldsymbol{x}_0) = \Vert \boldsymbol{h} \Vert^2 \left(\frac{m}{2} + o(1) \right) > 0

即当∥h∥\Vert \boldsymbol{h} \Vert充分小时,有f(x0+h)>f(x0)f(\boldsymbol{x}_0 + \boldsymbol{h}) > f(\boldsymbol{x}_0)。
(2)因为Hf(x0)Hf(\boldsymbol{x}_0)是不定方阵,故存在p,q∈Rn\boldsymbol{p},\boldsymbol{q} \in \mathbb{R}^n,使得
pTHf(x0)p<0<qTHf(x0)q \boldsymbol{p}^T Hf(\boldsymbol{x}_0) \boldsymbol{p} < 0 < \boldsymbol{q}^T Hf(\boldsymbol{x}_0) \boldsymbol{q}

在式(1)中分别取h\boldsymbol{h}为εp\varepsilon \boldsymbol{p}和εq\varepsilon \boldsymbol{q},得
f(x0+εp)−f(x0)=12(pTHf(x0)p)ε2+o(ε2)=(12pTHf(x0)p+o(1))ε2f(x0+εq)−f(x0)=(12qTHf(x0)q+o(1))ε2 \begin{aligned} f(\boldsymbol{x}_0 + \varepsilon \boldsymbol{p}) - f(\boldsymbol{x}_0) & = \frac{1}{2} (\boldsymbol{p}^T Hf(\boldsymbol{x}_0) \boldsymbol{p}) \varepsilon^2 + o(\varepsilon^2) \\ &= \left( \frac{1}{2} \boldsymbol{p}^T Hf(\boldsymbol{x}_0) \boldsymbol{p} + o(1) \right) \varepsilon^2 \\ f(\boldsymbol{x}_0 + \varepsilon \boldsymbol{q}) - f(\boldsymbol{x}_0) &= \left( \frac{1}{2} \boldsymbol{q}^T Hf(\boldsymbol{x}_0) \boldsymbol{q} + o(1) \right) \varepsilon^2 \end{aligned}

从而只要ε\varepsilon取得充分小,就有
f(x0+εp)<f(x0)<f(x0+εq) f(\boldsymbol{x}_0 + \varepsilon \boldsymbol{p}) < f(\boldsymbol{x}_0) < f(\boldsymbol{x}_0 + \varepsilon \boldsymbol{q})

也就表明x0\boldsymbol{x}_0不是ff的极值点。

Q.E.D.

定理3

设(x0,y0)(x_0,y_0)是二元函数ff的驻点,ff在(x0,y0)(x_0,y_0)的某个邻域内有连续的二阶偏导数,记

a=∂2f∂x2(x0,y0)b=∂2f∂x∂y(x0,y0)c=∂2f∂y2(x0,y0) a = \frac{\partial^2 f}{\partial x^2}(x_0, y_0) \quad b=\frac{\partial^2 f}{\partial x \partial y}(x_0, y_0) \quad c=\frac{\partial^2 f}{\partial y^2}(x_0, y_0)

那么:
(1)当ac−b2>0ac-b^2 > 0且a>0a > 0时,ff在(x0,y0)(x_0,y_0)处有严格极小值;
(2)当ac−b2>0ac-b^2 > 0且a<0a < 0时,ff在(x0,y0)(x_0,y_0)处有严格极大值;
(3)当ac−b2<0ac-b^2 < 0时,ff在(x0,y0)(x_0,y_0)处没有极值。

证:由定理2易证。

Q.E.D.

定义3:条件极值

设DD是Rn+m\mathbb{R}^{n+m}中的开集,

f(x1,⋯ ,xn,y1,⋯ ,ym)(2) f(x_1,\cdots,x_n,y_1,\cdots,y_m) \tag{2}

是定义在DD上的一个函数,先设变量x1,⋯ ,xn,y1,⋯ ,ymx_1,\cdots,x_n,y_1,\cdots,y_m满足以下mm个条件约束:
{Φ1(x1,⋯ ,xn,y1,⋯ ,ym)=0⋯Φm(x1,⋯ ,xn,y1,⋯ ,ym)=0(3) \left\{ \begin{aligned} & \Phi_1(x_1,\cdots,x_n,y_1,\cdots,y_m) = 0 \\ & \cdots \\ & \Phi_m(x_1, \cdots,x_n,y_1,\cdots,y_m) = 0 \end{aligned} \right. \tag{3}

那么函数(2)在条件(3)下的极值称为条件极值。

定理4

设开集D⊂Rn+mD \subset \mathbb{R}^{n+m},函数f:D→Rf: D \to \mathbb{R},映射Φ:D→Rm\boldsymbol{\Phi}: D \to \mathbb{R}^m,函数ff映射Φ\boldsymbol{\Phi}满足以下条件:
(a)f,Φ∈C1(D)f,\boldsymbol{\Phi} \in C^1(D)
(b)存在z0=(x0,y0)∈D\boldsymbol{z}_0 = (\boldsymbol{x}_0, \boldsymbol{y}_0) \in D,满足Φ(z0)=0\boldsymbol{\Phi}(\boldsymbol{z}_0) = 0,其中x0=(a1,⋯ ,an)\boldsymbol{x}_0 = (a_1,\cdots,a_n),yn=(b1,⋯ ,bm)\boldsymbol{y}_n=(b_1,\cdots,b_m);
(c)det⁡JyΦ(z0)≠0\det J_{\boldsymbol{y}}\boldsymbol{\Phi}(\boldsymbol{z}_0) \ne 0
如果ff在等式(3)的约束下,在z0\boldsymbol{z}_0处取得极值,那么存在λ∈Rm\boldsymbol{\lambda} \in \mathbb{R}^m,使得

Jf(z0)+λJΦ(z0)=0 Jf(\boldsymbol{z}_0) + \boldsymbol{\lambda} J\boldsymbol{\Phi}(\boldsymbol{z}_0) = \boldsymbol{0}

证:由于Φ\boldsymbol{\Phi}满足(a),(b),(c)三个条件,根据隐映射定理可知存在z0=(x0,y0)\boldsymbol{z}_0=(\boldsymbol{x}_0, \boldsymbol{y}_0)的邻域U=G×HU = G \times H,其中GG和HH分别是x0\boldsymbol{x_0}和y0\boldsymbol{y}_0的邻域,使得方程

Φ(x,y)=0 \boldsymbol{\Phi}(\boldsymbol{x}, \boldsymbol{y}) = \boldsymbol{0}

对任意的x∈G\boldsymbol{x} \in G,在HH中有唯一的解φ(x)\boldsymbol{\varphi}(\boldsymbol{x}),并且满足y0=φ(x0)\boldsymbol{y}_0 = \boldsymbol{\varphi}(\boldsymbol{x}_0)且
Jφ(x0)=−(JyΦ(z0))−1JxΦ(z0)(4) J\boldsymbol{\varphi}(\boldsymbol{x}_0) = -(J_y\boldsymbol{\Phi}(\boldsymbol{z}_0))^{-1}J_x\boldsymbol{\Phi}(\boldsymbol{z}_0) \tag{4}

由于z0\boldsymbol{z}_0是函数ff在条件式(2)下的极值点,从而x0\boldsymbol{x}_0便是函数f(x,φ(x))f(\boldsymbol{x}, \boldsymbol{\varphi}(\boldsymbol{x}))在GG中的一个极值点,所以x0\boldsymbol{x}_0必是f(x,φ(x))f(\boldsymbol{x}, \boldsymbol{\varphi}(\boldsymbol{x}))的一个驻点,从而有
Jxf(z0)+Jyf(z0)Jφ(x0)=0 J_xf(\boldsymbol{z}_0) + J_yf(\boldsymbol{z}_0)J\boldsymbol{\varphi}(\boldsymbol{x}_0) = \boldsymbol{0}

将(4)式代入上式可得
Jxf(z0)−Jyf(z0)(JyΦ(z0))−1JxΦ(z0)=0(5) J_xf(\boldsymbol{z}_0) - J_yf(\boldsymbol{z}_0)(J_y\boldsymbol{\Phi}(\boldsymbol{z}_0))^{-1}J_x\boldsymbol{\Phi}(\boldsymbol{z}_0) = \boldsymbol{0} \tag{5}

记
λ=−Jyf(z0)(JyΦ(z0))−1(6) \boldsymbol{\lambda} = -J_yf(\boldsymbol{z}_0)(J_y\boldsymbol{\Phi}(\boldsymbol{z}_0))^{-1} \tag{6}

它是一个mm维的向量,从而式(5)变成
Jxf(z0)+λJxΦ(z0)=0(7) J_xf(\boldsymbol{z}_0) + \boldsymbol{\lambda}J_x\boldsymbol{\Phi}(\boldsymbol{z}_0) = \boldsymbol{0} \tag{7}

将式(6)改写为
Jyf(z0)+λJyΦ(z0)=0(8) J_yf(\boldsymbol{z}_0) + \boldsymbol{\lambda}J_y\boldsymbol{\Phi}(\boldsymbol{z}_0) = \boldsymbol{0} \tag{8}

结合式(7)和式(8)可得
Jf(z0)+λJΦ(z0)=0 Jf(\boldsymbol{z}_0) + \boldsymbol{\lambda}J\boldsymbol{\Phi}(\boldsymbol{z}_0) = \boldsymbol{0}

Q.E.D.

定理5

设z0\boldsymbol{z}_0是辅助函数

F(z)=f(z)+∑i=1mλiΦi(z) F(\boldsymbol{z}) = f(\boldsymbol{z}) + \sum_{i=1}^m \lambda_i \Phi_i(\boldsymbol{z})

的一个驻点,其中z=(z1,⋯ ,zn+m)=(x1,⋯ ,xn,y1,⋯ ,ym)\boldsymbol{z} = (z_1,\cdots,z_{n+m}) = (x_1,\cdots,x_n,y_1,\cdots,y_m),记
HF(z0)=(∂2f∂zj∂zk(z0))i≤j,k≤m+n HF(\boldsymbol{z}_0) = \left( \frac{\partial^2 f}{\partial z_j \partial z_k}(\boldsymbol{z}_0) \right)_{i\le j,k \le m+n}

(1)如果HF(z0)HF(\boldsymbol{z}_0)严格正定,那么ff在z0\boldsymbol{z}_0处取得严格的极小值;
(2)如果HF(z0)HF(\boldsymbol{z}_0)严格负定,那么ff在z0\boldsymbol{z}_0处取得严格的极大值。

证:记EE是满足条件式(2)的点的全体,即

E={z∈Rm+n:Φ(z)=0} E = \left\{ \boldsymbol{z} \in \mathbb{R}^{m+n}: \boldsymbol{\Phi}(\boldsymbol{z}) = \boldsymbol{0} \right\}

已知z0∈E\boldsymbol{z}_0 \in E,再在z0\boldsymbol{z}_0的附近取点z0+h∈E\boldsymbol{z}_0 + \boldsymbol{h} \in E,由于
Φ(z0)=0,Φ(z0+h)=0 \boldsymbol{\Phi}(\boldsymbol{z}_0) = 0, \quad \boldsymbol{\Phi}(\boldsymbol{z}_0 + \boldsymbol{h}) = 0

所以
F(z0)=f(z0),F(z0+h)=f(z0+h) F(\boldsymbol{z}_0) = f(\boldsymbol{z}_0), \quad F(\boldsymbol{z}_0 + \boldsymbol{h}) = f(\boldsymbol{z}_0 + \boldsymbol{h})

于是对FF利用Taylor公式得
f(z0+h)−f(z0)=F(z0+h)−F(z0)=∑i=jm+n∂F∂zj(z0)hi+12∑j,k=1m+n∂2f∂zj∂zk(z0)hjhk+o(∥h∥2)=12hTHF(z0)h+o(∥h∥2) \begin{aligned} f(\boldsymbol{z}_0 + \boldsymbol{h}) - f(\boldsymbol{z}_0) &= F(\boldsymbol{z}_0 + \boldsymbol{h}) - F(\boldsymbol{z}_0) \\ &= \sum_{i=j}^{m+n} \frac{\partial F}{\partial z_j}(\boldsymbol{z}_0)h_i + \frac{1}{2}\sum_{j,k=1}^{m+n} \frac{\partial^2 f}{\partial z_j \partial z_k}(\boldsymbol{z}_0)h_jh_k + o(\Vert \boldsymbol{h} \Vert^2) \\ &= \frac{1}{2} \boldsymbol{h}^T HF(\boldsymbol{z}_0) \boldsymbol{h} + o(\Vert \boldsymbol{h} \Vert^2) \end{aligned}

接下来的证明方式与定理2完全一样,不再赘述。

Q.E.D.

继续这个系列