Matrix Theory: Matrix Norms, Spectral Radius, and Hermitian Matrices

Hyacehila

随着科学技术的迅速发展,古典的线性代数知识已不能满足现代科技的需要,矩阵的理论和方法业已成为现代科技领域必不可少的工具。

诸如数值分析、 优化理论、微分方程、概率统计、控制论、力学、电子学、网络等学科领域都与矩阵理论有着密切的联系,甚至在经济管理、金融、保险、社会科学等领域,矩阵理论和方法也有着十分重要的应用。

这里我们基于研究生最基本的矩阵论教材,讨论矩阵论中最核心的知识,至于那些已经在高等代数1 代数学基础 高等代数2 矩阵和线性空间 高等代数3 线性变换与欧式空间 中叙述过的知识,不再重复的解释。

本文前文仍旧是一个偏向于基础内容的叙述 是对高等代数学的补充。并不是矩阵分析理论的全部,我们还有很多深奥的矩阵分析理论可以学习。这里我们只强调矩阵分析的基础知识,而不侧重其再不同领域的应用与那些新兴理论,更难并且更少被用到的矩阵知识留给矩阵分析研究。

矩阵理论补充

矩阵范数

这是我们在高等代数学中没有介绍的关于矩阵的初等知识,他也和泛函分析联系的非常紧密,因此选择在矩阵论中补充。

矩阵的范数的前置知识是向量的范数,我们已经在泛函分析中的线性赋范空间和内积空间中介绍过了

矩阵范数的定义与性质

现在我们将范数这个衡量向量大小的概念推广到矩阵之上,将矩阵拉直,我们就能或者一个很长的一维向量,就可以把向量范数的概念推广过来。又因为矩阵存在乘法,而非仅仅有加法和数乘,因此需要而外补充公理来限制他

定义:设ACm×nA\in C^{m\times n} 按照某种法则规定AA上的一个实值函数,记作A||A|| 如果他满足下面四个条件

  • 非负性:: 如果 A0,A>0; 如果 A=0,A=0.:\text{ 如果 }A\neq\mathbf{0},\text{则}\parallel A\parallel>0;\text{ 如果 }A=\mathbf{0},\text{则}\parallel A\parallel=0.
  • 齐次性:对任意的 kC,kA=kA\text{对任意的 }k\in\mathbb{C},\parallel kA\parallel=\mid k\mid\parallel A\parallel
  • 三角不等式:对任意 A,BCm×n,A+BA+B\text{对任意 }A,B\in\mathbb{C}^{m\times n},\parallel A+B\parallel\leqslant\parallel A\parallel+\parallel B\parallel
  • 次乘性:当矩阵乘积ABAB有意义时,有ABAB\parallel AB\parallel\leqslant\parallel A\parallel\parallel B\parallel 则称A||A|| 是矩阵AA的范数

次乘性保证了幂零矩阵A2=0A^2=0 不与非负性冲突,以及矩阵级数的合理收敛性,其是非常合理的要求。

当我们把一个m×nm\times n维矩阵看成一个拉直后的向量的时候,我们可以很自然的给出一些矩阵范数,他们都限制在方阵了方阵前提下

  • Am1=i=1nj=1naij\parallel A\parallel_{m_1}=\sum_{i=1}^n\sum_{j=1}^n\mid a_{ij}\mid
  • Am=nmaxi,jaij\parallel A\parallel_{m_{\infty}}=n\bullet\max_{i,j}\mid a_{ij}\mid
  • Am2=(i=1nj=1naij2)12\parallel A\parallel_{m_2}=\left(\sum_{i=1}^n\sum_{j=1}^n\mid a_{ij}\mid^2\right)^{\frac{1}{2}} 特别的,方阵的2-范数非常的常用,我们称为Frobenius范数 写做AF||A||_F

我们可以不加证明的给出矩阵范数的重要定理:和向量范数一样,所有的矩阵范数都是等价的

算子范数

算子的概念我们在泛函分析中的线性算子中介绍过,他只是一种空间上的映射,在矩阵论中我们继续研究算子,不过只需要研究矩阵就足够了。

ACm×nA\in C^{m\times n}xCnx\in C^n 则有AxCmAx\in C^m 这其实就是算子AA在两个不同维数的向量空间上进行了映射,如果我们把xx看作矩阵 矩阵范数的次乘性有

AxAx\parallel Ax\parallel\leqslant\parallel A\parallel\parallel x\parallel

也就是说

AAxx\parallel A\parallel\geqslant\frac{\parallel Ax\parallel}{\parallel x\parallel}

不等式右侧是向量范数的比,左侧是尚未定义的矩阵范数,因此从向量范数定义矩阵范数有

A=supx0Axx\parallel A\parallel=\sup_{\parallel x\parallel\neq0}\frac{\parallel Ax\parallel}{\parallel x\parallel}

x=1||x||=1的时候,由于单位球面一定是有界闭集合,因此右侧是连续函数 sup可以换作max

如果我们同时定义了矩阵范数与向量范数,我们应该在定义时保证前述的不等式成立,这被我们称为两个范数相容。

对于已经规定了向量范数的情况,我们将矩阵范数

A=supx0Axx=maxx=1Ax\parallel A\parallel=\sup_{\parallel x\parallel\neq0}\frac{\parallel Ax\parallel}{\parallel x\parallel}=\max_{\parallel x\parallel=1}\parallel Ax\parallel

称为从向量范数诱导得到的矩阵范数,或称为算子范数

定理:设ACm×nA\in C^{m\times n} xCnx\in C^n 我们把向量xx的1范数 2范数以及无穷范数均向算子范数诱导可以分别得到

  • A1=maxi=1maij(称为列范数)\parallel A\parallel_1=\max_{i=1}^m\mid a_{ij}\mid\text{(称为列范数)}
  • A2=λmax(AHA)(称为谱范数)\parallel A\parallel_2=\sqrt{\lambda_{\max}(A^\mathrm{H}A)}(\text{称为谱范数)} 其中算子λmax\lambda_{max}是算矩阵的最大特征值
  • A=maxii=1naij(称为行范数)\parallel A\parallel_\infty=\max_i\sum_{i=1}^n\mid a_{ij}\mid\text{(称为行范数)}

谱范数与谱半径

我们知道,矩阵的算子范数A2\|A\|_2称为AA 的谱范数,它的值是通过矩阵 AHAA^\mathrm{H}A 的最大特征值来计算的,尽管求特征值比较麻烦,但这种范数有非常好的性质,所以在矩阵分析和系统理论中常常使用.下面专门讨论谱范数的性质

定理:设ACm×nA\in C^{m\times n}

  • A2=maxx2=y2=1yHAx,xCn,yCm\parallel A\parallel_2=\max_{\parallel x\parallel_2=\parallel y\parallel_2=1}\mid y^\mathrm{H}Ax\mid,x\in\mathbb{C}^n,y\in\mathbb{C}^m
  • AH2=A2\parallel A^\mathrm{H}\parallel_2=\parallel A\parallel_2
  • AHA2=A22\parallel A^\mathrm{H}A\parallel_2=\parallel A\parallel_2^2

定理:设ACm×n,UCm×m,VCn×n,UHU=ImVHV=InA\in C^{m\times n},U\in C^{m\times m},V\in C^{n\times n},U^{H}U=I_{m} V^HV=I_n

UAV2=A2\parallel UAV\parallel_2=\parallel A\parallel_2

定理:对于任意的算子范数,都有设ACn×nA\in C^{n\times n}A<1||A||<1IAI-A为非奇异矩阵,并且(IA)1(1A)1\parallel(I-A)^{-1}\parallel\leqslant(1-\parallel A\parallel)^{-1}

定义:设ACn×nA\in C^{n\times n}λ1,λ2,...,λn\lambda_1,\lambda_2,...,\lambda_n是他的特征值,我们称

ρ(A)=maxiλi\rho(A)=\max_i|\lambda_i|

是矩阵AA的谱半径

定理(特征值上界定理):对于任意ACn×nA\in C^{n\times n} 总有 ρ(A)A\rho(A)\leqslant\parallel A\parallel 也就是谱半径小于任何一种范数

定理:设ACn×nA\in C^{n\times n} 并且AA是正交矩阵,则有ρ(A)=A2\rho(A)=\parallel A\parallel_2

定理:对于任意非奇异矩阵ACn×nA\in C^{n\times n} 并且AA是正交矩阵 AA的谱范数为

ρ(A)=A2=ρ(AHA)=ρ(AAH)\rho(A)=\parallel A\parallel_2=\sqrt{\rho(A^\mathrm{H}A)}=\sqrt{\rho(AA^\mathrm{H})}

埃尔米特矩阵与变换

高等代数3 线性变换与欧式空间中的欧式空间中,我们介绍一类特殊的变换,保持欧式空间结构的不变性,也就是高等代数3 线性变换与欧式空间中的正交变换。事实上,还有一类有趣的变换以及他的矩阵我们没有介绍,就是埃尔米特变换。

我们从对称变换开始讨论,然后讨论埃尔米特变换以及矩阵,最后讨论我们在高等代数2 矩阵和线性空间中的二次型的拓展,埃尔米特正定矩阵。

对称变换与对称矩阵

定义:设AA是欧式空间VV上的一个线性变换,对于VV中的任意元素x,yx,y 都有

(A(x),y)=(x,A(y))(A(x),y)=(x,A(y))

则称AA是欧式空间VV上的一个对称变换

推论:根据定义我们就能容易的证明,对称变换AA在标准正交基下的矩阵是对称矩阵,也就是AT=AA^T=A 其逆命题同样成立。

根据对称矩阵的性质,我们可以给出两个运算性质

  • 如果AA是对称矩阵,那么(A(x),y)=(x,A(y))(A(x),y)=(x,A(y))
  • 如果AA不是对称矩阵,那么(A(x),y)=(x,AT(y))(A(x),y)=(x,A^T(y))

埃尔米特变换与埃尔米特矩阵

定义:设AA是酉空间(高等代数3 线性变换与欧式空间中的酉空间VV上的一个线性变换,对于VV中的任意元素x,yx,y 都有

(A(x),y)=(x,A(y))(A(x),y)=(x,A(y))

则称AA是酉空间VV上的一个埃尔米特变换

我们将矩阵AA的元素先共轭再转置整个矩阵称为AHA^H,也就是ATˉ=AH\bar{A^{T}}=A^H,这是为了简化后面将要出现的符号

推论:如果埃尔米特变换AA在标准正交基下的矩阵为AA,那么则有AH=AA^H=A ,我们将满足这样条件的矩阵称为埃尔米特矩阵。如果满足AH=AA^H=-A 则称为反埃尔米特矩阵

定理(Schur定理):任何nn阶矩阵都酉相似于一个上三角矩阵,也就是对于任意nn阶矩阵AA,存在一个nn阶酉矩阵UU和一个上三角矩阵TT ,满足

UHAU=TU^HAU=T TT的对角线的元素就是AA的特征值,顺序根据情况确定

推论:如果AA为埃尔米特矩阵,则AA一定酉相似于对角阵,其对角元(AA的特征值均为实数)

埃尔米特正定,半正定矩阵

定义:设AAnn阶埃尔米特矩阵,如果对任意nn维复向量xx都有

xнAx0,x^\text{н}Ax\geqslant0,

则称AA为埃尔米特非负定(半正定)矩阵,记作A0.A\geqslant0.如果对任意nn维非零复向量xx都有

xнAx>0,x^\text{н}Ax>0,

则称AA为埃尔米特正定矩阵,记作A>0.A>0.

我们之所以重复使用了正定的概念,是因为欧式空间上的对称矩阵研究了二次型有关的问题高等代数2 矩阵和线性空间中的二次型 而埃尔米特矩阵就是酉空间上的对称矩阵,因此我们研究埃尔米特二次型。

根据这个定义,我们容易给出

  • 单位矩阵I>0I>0
  • A>0,k>0A>0,k>0kA>0kA>0
  • A0,B0A\ge0,B\ge0A+B0A+B\ge 0

定理:矩阵AA为正定矩阵的充分必要条件为AA的所有特征值都是正数(半正定则改为非负数)

定理:矩阵AA为正定矩阵的充分必要条件为存在nn阶非奇异矩阵PP,使得A=PHPA=P^HP (半正定则把非奇异去除)

定理:正定矩阵AA的各阶顺序主子阵都是正定矩阵

定理:矩阵AA为正定矩阵的充分必要条件为AA的各阶顺序主子式都是正数或所有主子式都大于0

定理:设A,BA,Bnn阶埃尔米特矩阵,且B>0B>0 则存在非奇异矩阵QQ使得

QHBQ=I,QHAQ=diag(λ1,λ2,,λn).Q^\mathrm{H}BQ=I,\quad Q^\mathrm{H}AQ=\mathrm{diag}(\lambda_1,\lambda_2,\cdotp\cdotp\cdotp,\lambda_n).

埃尔米特矩阵的特征值

埃尔米特矩阵的特征值有一些非常值得研究的性质,我们这里简单介绍一些

本节所使用的矩阵大于和小于 如A>B,ABA>B,A\ge B 均意味着 其差是正定或者半正定的。

定理:设AAnn阶埃尔米特矩阵,则

λmin(A)IAλmax(A)I\lambda_{\min}(A)\boldsymbol{I}\leqslant A\leqslant\lambda_{\max}(A)\boldsymbol{I}

其中λmin(A),λmax(A)\lambda_{\min}(A),\lambda_{\max}(A) 是矩阵的最小和最大特征值

定义:设AAnn阶埃尔米特矩阵,对xCn\forall x\in\mathbb{C}^nx0x\neq\mathbf{0},称R(x)=xHAxxHx,x0R(x)=\frac{x^\mathrm{H}Ax}{x^\mathrm{H}x},\quad x\neq0为埃尔米特矩阵 AA 的瑞利商

定理(瑞利商的基本性质):设AAnn阶埃尔米特矩阵,其特征值为λ1λ2λn\lambda_1\geqslant\lambda_2\geqslant\cdotp\cdotp\cdotp\geqslant\lambda_n,则

  • R(kx)=R(x),kC,k0;R(k\boldsymbol{x})=R(\boldsymbol{x}),k\in\mathbb{C},k\neq0;
  • λnR(x)λ1\lambda _n\leqslant R( x) \leqslant \lambda _1 ,x0, x\neq 0 ;
  • λ1=maxx0R(x),λn=minx0R(x).\lambda_{1}=\operatorname*{max}_{x\neq0}R\left(x\right),\lambda_{n}=\operatorname*{min}_{x\neq0}R\left(x\right).

定理(极大极小定理):设AAnn阶埃尔米特矩阵,其特征值为λ1λ2λn\lambda_1\geqslant\lambda_2\geqslant\cdotp\cdotp\cdotp\geqslant\lambda_n, ViV_iCnC^nii维子空间,则

λi=maxViminx0,xViR(x),λi=minVni+1maxxVni+1,x0R(x)\lambda_i=\max_{V_i}\underset{x\neq0,x\in V_i}{\operatorname*{\operatorname*{min}}}R(x),\lambda_i=\min_{V_{n-i+1}}\max_{\begin{array}{c}x\in V_{n-i+1},x\neq0\end{array}}R(x)

使用极大极小定理,我们可以研究埃尔米特矩阵的元素发生微小变化的时候,相应的矩阵特征值的变换范围

定理: 设A,EA,E均为nn阶埃尔米特矩阵,B=A+E,B=A+E,且A,BA,BEE的特征值分别为

λ1λn,μ1μn\lambda_1\geqslant\cdots\geqslant\lambda_n,\mu_1\geqslant\cdots\geqslant\mu_nε1εn\varepsilon_1\geqslant\cdots\geqslant\varepsilon_n,则 λi+εnμiλi+ε1,i=1,2,,n.\lambda_i+\varepsilon_n\leqslant\mu_i\leqslant\lambda_i+\varepsilon_1,\quad i=1,2,\cdotp\cdotp\cdotp,n.

摄动分析

在数值计算中,通常存在两类误差影响计算结果的精度,即计算方法引起的截断误差和计算环境引起的舍人误差.为了分析这些误差对数学问题解的影响,人们将其归结为原始数据的扰动(或摄动)对解的影响.下面我们将分别研究在线性方程组求解和矩阵特征值求解过程中,因原始数据的摄动而引起问题的解有多大的变化,即研究问题解的稳定性.

病态方程组与病态矩阵

考虑下面这个简单的二元方程组

[10.990.990.98][x1x2]=[11]\begin{bmatrix}1&0.99\\0.99&0.98\end{bmatrix}\begin{bmatrix}x_1\\x_2\end{bmatrix}=\begin{bmatrix}1\\1\end{bmatrix}

其精确解为 x1=100,x2=100x_1=100,x_2=-100

将方程组进行微小的摄动,由于真实实验的误差等因素,这种摄动非常常见

[10.990.990.99](x1+δx1x2+δx2)=[11.001]\begin{bmatrix}1&0.99\\0.99&0.99\end{bmatrix}\begin{pmatrix}x_1+\delta x_1\\\\x_2+\delta x_2\end{pmatrix}=\begin{bmatrix}1\\1.001\end{bmatrix}

则方程组的精确解变为x1+δx1=0.1,x2+δx2=109x_1+\delta x_1=-0.1,x_2+\delta x_2=\frac{10}{9}

能看出,虽然我们对原始系数的摄动很微小,但是方程组的解变化巨大,这种现象就是病态。

定义:如果系数矩阵AA或常数项bb的微小变化,引起方程组Ax=bAx=b解的巨大变化,则称方程组为病态方程组,其系数矩阵AA就叫做对应于解方程组(或求逆)的病态矩阵; 反之,方程组就称为良态方程组,AA称良态矩阵。

应该指出,谈到“病态矩阵”概念时,必须明确它是对什么而言的.因为对于解方程组(或求逆)来说是病态矩阵,对于求特征值来说并不一定是病态的,反之亦然.所以我们不能笼统地说某个矩阵是“病态”的。

矩阵的条件数

了解了病态的概念之后,我们开始研究衡量一个矩阵病态的标准。至于标准为什么是这样不再讨论。

定义:设 A 为非奇异矩阵,称数 cond(A)=A1ρAρ(p=1,2(\boldsymbol{A})=\left\|\boldsymbol{A}^{-1}\right\|_{\rho}\left\|\boldsymbol{A}\right\|_{\rho}(p=1,2)\infty)为矩阵 AA 的条件数.

由此看出矩阵的条件数与范数有关,它刻画了方程组解的相对误差可能的放大率,我们一般认为远大于1的条件数是不良好的性质,对应小于1的条件数是比较好的。但是缺少更为确切的标准。

最常用的条件数是谱条件数

cond(A)2=A2A12=λmax(AHA)λmin(AHA).\begin{aligned}\operatorname{cond}(A)_2&=\parallel A\parallel_2\parallel A^{-1}\parallel_2\\&=\sqrt{\frac{\lambda_{\max}(A^{\mathrm{H}}A)}{\lambda_{\min}(A^{\mathrm{H}}A)}}.\end{aligned}

这是线性回归基础中的条件数判别法的推广

矩阵特征值的摄动分析

前面我们是针对线性方程组的求解问题进行研究,现在考虑求矩阵特征值的摄动分析。高阶矩阵特征值的精确求解是比较困难的,因此我们研究近似。

定义:设A=(aijA=(a_{ij} )为任一nn阶复数矩阵,复平面上的nn个圆盘

G_i( \boldsymbol{A}) : \mid z- a_{ii}\mid \leqslant R_i$, $i= 1, 2, \cdots , n

这里以Ri=j=1aijR_{i}=\sum_{j=1}\mid a_{ij}\mid为半径的圆(即圆盘的边界),称为矩阵 AA 的 Gerschgorin 圆,简称盖尔圆.

定理(盖尔定理又称圆盘定理):设 A=(aij)Cn×nA=(a_{\mathrm{i}j})\in\mathbb{C}^{n\times n},则

  • AA 的特征值都在 nn 个圆盘Gi(A)G_i(\mathbf{A})的并集内(换句话说,A\mathbf{A} 的每个特征值都落在AA 的某个圆盘之内),即
λ(A)i=1nGi(A);\lambda(A)\subseteq\bigcup_{i=1}^nG_i(A)\:;
  • 矩阵AA的任一个由mm个圆盘组成的连通区域中,有且只有AAmm个特征值(当AA的主对角线上有相同元素时,则按重复次数计算,有相同特征值时也需按重复次数计算).

圆盘定理可以帮助我们估计特征值的大致所在区间,复平面上的点就是一个复数,可能是复矩阵的特征值

定义:设 ACn×nA\in\mathbb{C}^{n\times n},并且存在可逆矩阵 PP 使得 P1AP=diag(λ1,,λn)P^{-1}AP=\operatorname{diag}(\lambda_1,\ldots,\lambda_n),则称P1P\parallel\boldsymbol{P}^{-1}\parallel\parallel\boldsymbol{P}\parallel为矩阵AA关于特征值问题的“条件数”,简称特征条件数,记为ζ(P).\zeta(\boldsymbol{P}).ζ(P)=P1P\zeta(\boldsymbol{P})=\parallel\boldsymbol{P}^{-1}\parallel\parallel\boldsymbol{P}\parallel不是很大,则 A\boldsymbol{A} 的特征值问题是良态的

对于埃尔米特矩阵(酉空间的对称矩阵)我们还有 定理:设A,EA,E均为nn阶埃尔米特矩阵,B=A+E,B=A+E,且A,BA,BEE的特征值分别为

λ1λ2λn,μ1μ2μn\lambda_1\geq\lambda_2\geq\cdots\geq\lambda_n,\mu_1\geqslant\mu_2\geqslant\cdots\geq\mu_nε1ε2εn\varepsilon_1\geq\varepsilon_2\geq\cdots\geqslant\varepsilon_n,则 λiμiE2,i=1,2,,n.\mid\lambda_i-\mu_i\mid\leqslant\parallel E\parallel_2,\quad i=1,2,\cdotp\cdotp\cdotp,n.

能看出埃尔米特矩阵的特征条件数为1,这意味着埃尔米特矩阵在特征值问题上,都是良态的。

矩阵分解

矩阵分解对矩阵理论及近代计算数学的发展起了关键作用.所谓矩阵分解,就是将一个矩阵写成结构比较简单的或性质比较熟悉的另一些矩阵的乘积。

我们在高等代数中研究过对角化,研究过Joran标准型等等问题,他们都属于矩阵分解的一种。不过以前的理论更少的关注应用,难以实现简化计算与深入理论的问题。

因此本章对常见的矩阵分解进行汇总研究,他们有的基于曾经学过的理论,还有一些则完全陌生,但是他们在近代计算数学中都发挥了很重要的作用

三角分解

高斯消元

我们在高等代数1 代数学基础中的高斯消元中介绍过求解方程组的矩阵消元,实际上就是将初始矩阵变为了一个上三角矩阵,并且只使用了行变换,理解高斯消元的本质就可以让我们对三角分解有完整的理解。

对于一个nn元的线性方程组,我们直接用矩阵形式表示

Ax=bAx=b

高斯消元就是在利用矩阵的初等行变换将矩阵AA变换为上三角矩阵,我们假设全程不交换行的顺序(这也是很正常的选择),那么每一次行变换就是左乘一个对应的初等矩阵。由于在矩阵分解领域我们只考虑方阵,那么高斯消元的最终结果为

L(n1)L(2)L(1)A(1)=[a11(1)a12(1)a1n(1)a22(2)a2n(2)ann(n)]=A(n)L^{(n-1)}\cdots L^{(2)}L^{(1)}A^{(1)}=\begin{bmatrix}a_{11}^{(1)}&a_{12}^{(1)}&\cdots&a_{1n}^{(1)}\\&a_{22}^{(2)}&\cdots&a_{2n}^{(2)}\\&&\ddots&\vdots\\&&&a_{nn}^{(n)}\end{bmatrix}=A^{(n)}

事实上,想要消元到这种形式,我们需要保证对角线元素不为0,因此可以给出下面的定理

定理:当nn阶矩阵AA的前n1n-1阶顺序主子式都不为0的时候,则对角线元素不为0,高斯消元可以进行到底。

矩阵的三角分解

当前一节所叙述的分解可以正常进行到底时,记U=AnU=A^{n}

L(n1)L(2)L(1)A=UL^{(n-1)}\cdot\cdot\cdot L^{(2)}L^{(1)}A=U

也就是

A=(L(1))1(L(2))1(L(n1))1UA=(L^{(1)})^{-1}(L^{(2)})^{-1}\cdots(L^{(n-1)})^{-1}U

根据逆矩阵的定义知道 (L(1))1(L^{(1)})^{-1} 是下三角矩阵,因此其连乘积也是下三角矩阵,也就是说

L=(L(1))1(L(2))1(L(n1))1=[1l211l31l321l41l42l431llnln2ln3ln,n11]L=(L^{(1)})^{-1}(L^{(2)})^{-1}\cdotp\cdotp\cdotp(L^{(n-1)})^{-1}=\begin{bmatrix}1&&&&&&\\l_{21}&1&&&&&\\l_{31}&l_{32}&1&&&&\\l_{41}&l_{42}&l_{43}&\ddots&&&\\\vdots&\vdots&\vdots&\ddots&1&&\\l_{ln}&l_{n2}&l_{n3}&\cdots&l_{n,n-1}&1\end{bmatrix}

是对角线元素均为1的下三角矩阵

综上所述,我们可以将初始矩阵AA分解

A=LUA=LU

初始矩阵被分解为一个上三角矩阵和一个下三角矩阵的乘积

定义:如果方阵AA可分解成一个下三角矩阵LL和一个上三角矩阵UU的乘积,则称AA可作三角分解或LULU分解。如果LL是单位下三角矩阵,UU为上三角矩阵,此时的三角分解称为杜利特(Doolittle)分解;若LL 是下三角矩阵,而UU 是单位上三角矩阵,则称三角分解为克劳特(Crout)分解。

从定义能看出,矩阵的三角分解一定不是唯一的,最起码还有Doolittle分解和Crout分解两种,事实上

A=LU=LDD1U=(LD)(D1U)=L~U~A=LU=LDD^{-1}U=(LD)(D^{-1}U)=\widetilde{L}\widetilde{U}

由此我们就可以从一个分解中找到无数个分解,DD只需要是行列式不为0的任意对角矩阵即可。为此,我们希望寻找一种具有唯一性的三角分解

定理 (LDU 基本定理) 设AAnn 阶方阵,则 AA 可以惟一地分解为

A=LDUA=LDU

的充分必要条件是AA的前n1n-1个顺序主子式Δk0(k=1,2,,n1).\Delta_k\neq0(k=1,2,\cdotp\cdotp\cdotp,n-1).其中L,UL,U分别是单位下、上三角矩阵,DD是对角矩阵

D=diag(d1,d2,,dn),D=\operatorname{diag}(d_1,d_2,\cdotp\cdotp\cdotp,d_n), dk=ΔkΔk1,k=1,2,,n,Δ0=1.d_k=\frac{\Delta_k}{\Delta_{k-1}},\quad k=1,2,\cdots,n,\quad\Delta_0=1.

有了LDU定理,我们找到三角分解的存在唯一性,据此可以很容易给出Doolittle分解和Crout分解的存在唯一性

推论:设AAnn 阶方阵,则 AA 可以惟一地进行杜利特分解的充分必要条件是A 的前n1n-1个顺序主子式

Δk=a11a1kak1akk0,k=1,2,,n1,\Delta_{k}=\begin{vmatrix}a_{11}&\cdots&a_{1k}\\\vdots&&\vdots\\a_{k1}&\cdots&a_{kk}\end{vmatrix}\neq0,\quad k=1,2,\cdots,n-1,

其中LL 为单位下三角矩阵,U~\tilde{U} 是上三角矩阵,即有

A=[1l211l31l321ln1ln2ln,n11](u11u12u1nu22u2nunn),\mathbf{A}=\begin{bmatrix}1&&&&&\\l_{21}&1&&&&\\l_{31}&l_{32}&\ddots&&&\\\vdots&\vdots&\ddots&1&&\\l_{n1}&l_{n2}&\cdots&l_{n,n-1}&1\end{bmatrix}\begin{pmatrix}u_{11}&u_{12}&\cdots&u_{1n}\\&u_{22}&\cdots&u_{2n}\\&&\ddots&\vdots\\&&&u_{nn}\end{pmatrix},

并且若AA为奇异矩阵,则unn=0;u_{nn}=0;AA为非奇异矩阵,则充要条件可换为:AA的各阶顺序主子式全不为零,即:

Δk0,k=1,2,,n.\Delta_k\neq0,\quad k=1,2,\cdotp\cdotp\cdotp,n.

推论 2 nn阶方阵AA可惟一地进行克劳特分解

A=L~U=[l11l21l22ln1ln2lnn](1u12u1n1u2n1)A=\tilde{\boldsymbol{L}}\boldsymbol{U}=\begin{bmatrix}l_{11}&&&\\l_{21}&l_{22}&&\\\vdots&\vdots&\ddots&\\l_{n1}&l_{n2}&\cdots&l_{nn}\end{bmatrix}\begin{pmatrix}1&u_{12}&\cdots&u_{1n}\\&1&\cdots&u_{2n}\\&&\ddots&\vdots\\&&&1\end{pmatrix}

的充要条件仍为式前推论中n1n-1阶的情况.若AA为奇异矩阵,则lnm=0;l_{nm}=0;AA为非奇异矩阵,则充要条件也可换为前述中各阶的情况

常用的三角分解

在实际应用中,如果矩阵AA的阶数nn很高 ,那么按消元步骤来得出AA的三角分解是相当麻烦的.下面我们将分别根据 A 的不对称和对称的情况,介绍两个常用的直接三角分解公式

Crout分解

AAnn阶方阵(但不一定对称),且有分解式

A=LU,A=LU,

(a11a1ja1nai1aijainan1anjann)=(l11li1liiln1lnn)(1u12u1ju1n1uj1,juj1,n11)\begin{pmatrix}a_{11}&\cdots&a_{1j}&\cdots&a_{1n}\\\vdots&&\vdots&&\vdots\\a_{i1}&\cdots&a_{ij}&\cdots&a_{in}\\\vdots&&\vdots&&\vdots\\a_{n1}&\cdots&a_{nj}&\cdots&a_{nn}\end{pmatrix}=\begin{pmatrix}l_{11}&&&&&\\\vdots&\ddots&&&&\\l_{i1}&\cdots&l_{ii}&&&\\\vdots&&&\ddots&&\\l_{n1}&\cdots&\cdots&\cdots&l_{nn}\end{pmatrix}\begin{pmatrix}1&u_{12}&\cdots&u_{1j}&\cdots&u_{1n}\\&\ddots&&\vdots&&\vdots\\&&1&u_{j-1,j}&\cdots&u_{j-1,n}\\&&&\ddots&&\vdots\\&&&&1&1\end{pmatrix}

下面给出矩阵各元素的计算方法

iji\ge j 的时候(表示计算下三角位置)

lij=aijk=1j1likukj,i=1,,n,j=1,,i;l_{ij}=a_{ij}-\sum_{k=1}^{j-1}l_{ik}u_{kj},\quad i=1,\cdots,n,\quad j=1,\cdots,i;

i<ji< j 的时候(表示计算下三角位置)

uij=(aijk=1ilikukj)/lii,i=1,,n1,j=i+1,,n.u_{ij}=\left(a_{ij}-\sum_{k=1}^{i}l_{ik}u_{kj}\right)/l_{ii},\quad i=1,\cdots,n-1,\quad j=i+1,\cdots,n.

我们需要迭代使用这两个公式逐步进行求解

Doolittle分解

类似的,我们可以给出Doolittle分解下面的求解式

{uij=aijk=1i1likukj,i=1,,n,j=i,,n,lij=(aijk=1j1likukj)/ujj,i=2,,n,j=1,,i1.\begin{cases}u_{ij}=a_{ij}-\sum_{k=1}^{i-1}l_{ik}u_{kj},&i=1,\cdots,n,&j=i,\cdots,n,\\\\l_{ij}=\left(a_{ij}-\sum_{k=1}^{j-1}l_{ik}u_{kj}\right)/u_{jj},&i=2,\cdots,n,&j=1,\cdots,i-1.&\end{cases}
Cholesky分解

如果AA是对称正定矩阵,则可以使三角分解的计算量大为减少,大约是前述的克劳特分解或杜利特分解工作量的一半.

定理:设AAnn阶对称正定矩阵,则存在一个实的非奇异下三角矩阵LL,使

A=LLT.A=LL^{\mathrm{T}}.

如果限定LL 的对角元素为正时,这种分解是惟一的.

我们可以轻松的给出求解公式,由于其对称性我们只需要计算一半

lij=(aijk=1j1likljk)/ljj,ij.l_{ij}=\left(a_{ij}-\sum_{k=1}^{j-1}l_{ik}l_{jk}\right)/l_{jj},\quad i\geqslant j.

特别的,当i=ji=j的时候

lii=aiik=1i1lik2l_{ii}=\sqrt{a_{ii}-\sum_{k=1}^{i-1}l_{ik}^2}

由于需要进行不少的平方根变换,他也被称为平方根分解

QR(正交三角)分解

由于LU三角分解不能解决一些病态方程组的问题,于此同时有些可逆矩阵不存在LU分解,因此我们需要提出更为优秀的分解方法,这就是QR分解,他对一切可逆矩阵均存在。

QR分解的概念

定义:如果实(复)非奇异矩阵AA能化成正交(西)矩阵QQ与实(复)非奇异上三角 矩阵RR的乘积,即

A=QR,A=QR\:,

则称其是AA的QR分解

更为常用的QR分解针对实数而言,因此我们后面主要讨论实矩阵的正交分解,同时给出部分复分解的结论。

定理:任何实的非奇异nn阶矩阵 A 可以分解成正交矩阵QQ和上三角矩阵 R 的乘积,且除去相差一个对角线元素之绝对值全等于 1 的对角矩阵因子DD外,分解式是惟一的.

所谓的相差一个对角矩阵因子DD 指的是 A=QD1DRA=QD^{-1}DR 当规定RR的对角线元素都是正实数的时候,D=ID=I 此时分解唯一。

最基础的QR分解使用Schmit正交化进行,如下

  • AA的列向量由于AA是非奇异的,因此一定线性无关,对列向量αi\alpha_i 进行Schmit正交化有(β1,β2,,βn)=(α1,α2,,αn)B(\beta_1,\beta_2,\cdots,\beta_n)=(\alpha_1,\alpha_2,\cdots,\alpha_n)B
  • 此时可以给出 Q=ABQ=AB
  • B1=RB^{-1}=R是上三角矩阵 此时有 A=QB1=QRA=QB^{-1}=QR

QR分解的计算

正交化求解QR分解比较复杂,因此我们这里介绍一些其他的计算方法,他们在更加复杂的问题中有着更好的效果。

Givens方法

Givens方法基于矩阵的初等旋转变换,通过不断的左乘RR 消去AA的非零元素,最后化简到上三角矩阵

定理:任何实非奇异矩阵可通过左连乘初等旋转阵化为上三角阵

这个定理的证明就是寻找QR分解的过程

对实可逆矩阵A=(aiA=(a_i,)左乘以初等旋转阵RijR_{ij}以后,只改变AA的第ii行和第jj 行元素.设A=RijAA^{\prime}=R_{ij}A 则变换的效果为

aig=caig+sajg,ajg=saig+cajg,ajg=ajg,pi,j;g=1,2,,n.a_{ig}^{\prime}=ca_{ig}+sa_{jg},\quad a_{jg}^{\prime}=-sa_{ig}+ca_{jg},\quad a_{jg}^{\prime}=a_{jg},\quad p\neq i,j;g=1,2,\cdots,n.

如果想要 ajg0=0a_{jg_0}^{\prime}=0 那么只需要aig0和 ajg0a_{ig_0}\text{和 }a_{jg_0} 之一不为0,并且取

s=ajg0aig02+ajg02,c=aig0aig02+ajg02s=\frac{a_{jg_0}}{\sqrt{a_{ig_0}^2+a_{jg_0}^2}},\quad c=\frac{a_{ig_0}}{\sqrt{a_{ig_0}^2+a_{jg_0}^2}}

此时

aig0=aig02+aig02>0a_{ig_0}^{\prime}=\sqrt{a_{ig_0}^2+a_{ig_0}^2}>0

也就是说,该变换的效果为 g0g_0jj行化0,g0g_0ii行变正 其他元素不变

有了这样的变换后,我们就可以通过不断左乘初等旋转矩阵,将矩阵变换为上三角矩阵,也就是

A(n1)=Rn1,nR12A=[a11(1)a12(1)a1n(1)0a22(2)a2n(2)00ann(n1)]\begin{aligned}A^{(n-1)}&=\boldsymbol{R}_{n-1,n}\cdots\boldsymbol{R}_{12}\boldsymbol{A}\\&=\begin{bmatrix}a_{11}^{(1)}&a_{12}^{(1)}&\cdots&a_{1n}^{(1)}\\0&a_{22}^{(2)}&\cdots&a_{2n}^{(2)}\\\vdots&\vdots&\ddots&\vdots\\0&0&\cdots&a_{nn}^{(n-1)}\end{bmatrix}\end{aligned}

这实际上就蕴含了一个QR分解

R=A(n1){R}={A}^{(n-1)} Q=(Rn1,nR12)1Q=(R_{n-1,n}\cdotp\cdotp\cdotp R_{12})^{-1}

由于初等旋转矩阵的正交性,所以有QR分解

A=QR.A=QR.

Givens方法需要计算 n(n1)2\frac{n(n-1)}{2} 个初等旋转矩阵的积,因此在高维矩阵上并不实用

Housholder方法

定理:任何实的nn阶矩阵AA可用初等反射矩阵H=I2ωωTH=I-2\omega\omega^\mathrm{T}化为上三角矩阵.

该方法具体证明我们不再讨论,其思想也是通过不断左乘初等反射矩阵化为上三角矩阵,然后用类似于Givens的方法求逆,得到原始矩阵的QR分解,其计算量和矩阵维数线性增加,在处理高维非稀疏矩阵比Givens方法更快。

最大秩分解

以上两节主要是介绍了nn阶方阵的几种分解,从本节开始,将介绍几种常用的长方阵的分解

定义:设m×nm\times n矩阵

A=[a11a12a1na21a22a2nam1am2amn],\mathbf{A}=\begin{bmatrix}a_{11}&a_{12}&\cdots&a_{1n}\\a_{21}&a_{22}&\cdots&a_{2n}\\\vdots&\vdots&&\vdots\\a_{m1}&a_{m2}&\cdots&a_{mn}\end{bmatrix},

如果当mnm\leqslant n时 ,存在有 rankA=m;\boldsymbol{A}=m;或者当mnm\geqslant n时 ,存在有 rankA=n\boldsymbol{A}=n,则称这两种长方阵为最大秩长方阵(满秩长方阵),前者又称行最大秩矩阵(行满秩矩阵或矮矩阵),后者又称为列最大秩矩阵(列满秩矩阵或高矩阵)

最大秩长方阵指的是这个长方形矩阵有其拥有的最大的秩

显然,最大秩长方阵具有如下性质

rank(AAT)=m,A=(aij)m×n,mn\operatorname{rank}(AA^\mathrm{T})=m,\quad\mathbf{A}=\left(a_{ij}\right)_{m\times n},m\leqslant n

rank(ATA)=n,A=(aij)m×n,mn.\mathrm{rank}(A^\mathrm{T}A)=n\:,\quad A=(a_{ij})_{m\times n},m\geqslant n.

定义:设AAm×nm\times n且秩为r>0r>0的复矩阵,且记为ACrm×nA\in\mathbb{C}_r^{m\times n},如果存在矩阵

BCrm×rB\in\mathbb{C}_r^{m\times r}CCrr×nC\in\mathbb{C}_r^{r\times n},使 A=BC,A=BC\:,

则称其的分解为矩阵 A 的最大秩分解(满秩分解).

显然,当AA是列最大秩(列满秩)或行最大秩(行满秩)矩阵时,AA的最大秩分解的两个因子中,一个因子是单位矩阵,另一个因子是AA本身,称这种最大秩分解为平凡分解.

定理:设 ACrm×nA\in\mathbb{C}_r^{m\times n},则一定存在 BCrm×r\boldsymbol{B}\in\mathbb{C}_r^{m\times r}CCrr×nC\in\mathbb{C}_r^{r\times n}使得

A=BC.A=BC.

定理的证明过程就是寻找矩阵B,CB,C的过程,思路是先求矩阵AA的行标准形,然后取标准化后AA的前rr列作为BB,取AA的前rr非零行作为矩阵CC

如果我们把AA进行列标准化,再取前rr列作为BB,前rr非零行作为矩阵CC 我们能得到另一种最大秩分解。这意味着,最大秩分解不具备唯一性,但是可能性有限,实际上两种最大秩分解的

CH(CCH)1(BHB)1BHC^{\mathrm{H}}(CC^{\mathrm{H}})^{-1}(B^{\mathrm{H}}B)^{-1}B^{\mathrm{H}}

是相同的,这个形式就是我们在矩阵分析中会研究的穆尔-彭罗斯逆

奇异值分解SVD与极分解

矩阵的奇异值分解在矩阵理论中的重要性是不言而喻的,例如古典控制中的频率法,正是由于有了矩阵奇异值分解的帮助而得到了新的发展.这里,只给出奇异值的性质以及矩阵按奇异值的分解。

首先,我们需要给出一些预备知识,关于矩阵的特征值与奇异值

命题:设 ACm×nA\in\mathbb{C}^m\times n,则有

  • AHAA^\mathrm{H}AAAHAA^\mathrm{H} 的特征值均为非负实数;
  • AHAA^\mathrm{H}AAAHAA^\mathrm{H}的非零特征值相同.

定义:设ACrm×n,AHAA\in\mathbb{C}_r^{m\times n},A^{\mathrm{H}}A的特征值为

λ1λ2λr>λr+1=λr+2==λn=0,\lambda_1\geqslant\lambda_2\geqslant\cdots\lambda_r>\lambda_{r+1}=\lambda_{r+2}=\cdots=\lambda_n=0,

则称 σi=λi(i=1,2,,r)\sigma_i=\sqrt{\lambda_i}\left(i=1,2,\cdots,r\right)矩阵 AA 的正奇异值,简称奇异值. 由此定义和命题可知 ,A,AAHA^\mathrm{H} 有相同的奇异值

定义:设A,BCm×nA,B\in\mathbb{C}^{m\times n},如果存在mm阶酉矩阵UUnn阶酉矩阵VV,使得

B=UAV,B=UAV,

则称AABB酉等价或酉相低。

定理:若AABB 酉等价,则AABB有相同的奇异值.

定理:设ACrm×nA\in\mathbb{C}_r^{m\times n},则存在mm阶酉矩阵UUnn阶西矩阵VV,使得

UнAV=[Δ000]U^\text{н}AV=\begin{bmatrix}\Delta&0\\0&0\end{bmatrix}

A=U[Δ000]VH,A=U{\begin{bmatrix}\Delta&0\\0&0\end{bmatrix}}V^{\mathrm{H}}\:,

其中Δ=diag(σ1,σ2,,σr),λi\Delta=\operatorname{diag}(\sigma_{1},\sigma_{2},\cdots,\sigma_{r}),\lambda_{i}AAHAA^\mathrm{H}的非零特征值,且σi=λi(i=1,2,,r)\sigma_i=\sqrt{\lambda_{i}}\left(i=1,2,\cdots,r\right),而σi\sigma_iAA的全部奇异值. 这就称为矩阵AA的奇异值分解,本质上是研究AA与一个长方形对角矩阵的酉等价

计算矩阵的奇异值分解很简单,奇异值矩阵只需要直接计算奇异值就可以得到,按顺序排列。矩阵U,VU,V只需要计算AHA,AAHA^HA,AA^H的特征向量构成的列矩阵

设可逆矩阵AA的奇异值分解为A=UDVHA=UDV^\mathrm{H},则其逆的奇异值分解为A1=VD1UH.A^{-1}=VD^{-1}U^{\mathrm{H}}.因此,若 AA 的奇异值为σ1σ2σn>0\sigma_1\geqslant\sigma_2\geqslant\cdotp\cdotp\cdotp\geqslant\sigma_n>0,则 A1A^{-1} 的奇异值为 1/σn1/σn1/\sigma_n\geqslant1/\sigma_n 1/σ1>0.\geqslant\cdotp\cdotp\cdotp\geqslant1/\sigma_1>0.A=U1DVHA=U_1DV^\mathrm{H}AA的奇异值分解 ,令

P=U1DU1H,U=U1VH,P=U_1DU_1^H,\quad U=U_1V^H,

即可得到矩阵的另一种有趣分解——极分解.

定理:设 ACn×nA\in\mathbb{C}^{n\times n},则存在酉矩阵 UU 和惟一的半正定矩阵 PP,使得

A=PU,A=PU,

上式称为矩阵AA的极分解.矩阵PPUU分别称为AA的埃尔米特因子和西因子.

特别的,我们这里简单研究一下特征值和奇异值的一些性质

定理(奇异值与特征值) :设λ\lambdann阶矩阵AA的一个特征值,又将AA的最大奇异值与最小奇异值分别记为σmax(A)\sigma_\mathrm{max}(\boldsymbol{A})σmin(A)\sigma_\mathrm{min}(\boldsymbol{A}),则σmax(A)λσmin(A).\sigma_\mathrm{max}(\boldsymbol{A})\geqslant|\lambda|\geqslant\sigma_\mathrm{min}(\boldsymbol{A}).换言之,矩阵的最大奇异值与最小奇异值是其特征值的模的上下界.

定理(奇异值与矩阵的迹) :设 ACm×nA\in\mathbb{C}^{m\times n},则 tr(AHA)=i=1σi2.(A^\mathrm{H}A)=\sum_{i=1}\sigma_i^2.

定理(奇异值与奇异矩阵) :矩阵AA列满秩A\Leftrightarrow A的奇异值均非 0.特别地,方阵AA非奇异A\Leftrightarrow A 的奇异值均非0。事实上,矩阵非零奇异值的个数和秩相等

谱分解

所有的矩阵分解都是为了简化问题,因此本章我们再介绍一种性质优秀的矩阵:可以酉对角化的矩阵

正规矩阵

定义:设AA是复数域上的方阵,如果有

AAн=AнA,AA^\text{н}=A^\text{н}A,

则称 AA 为正规矩阵.

如果AA是实数域上的nn阶方阵,且有

AAT=ATA,AA^{\mathrm{T}}=A^{\mathrm{T}}A,

则称 AA 为实正规矩阵.

我们容易验证,对称矩阵、反对称矩阵(A=ATA=-A^{\mathrm{T}}),正交矩阵都是实正规矩阵;而酉矩阵、埃尔米特矩阵、反埃尔米特矩阵(即A=AHA=-A^{\mathrm{H}})均属于复正规矩阵.

定理:设 ACn×nA\in\mathbb{C}^{n\times n},则 AA 酉相似于对角矩阵的充分必要条件是AA 为正规矩阵

事实上,实对称矩阵正交相似与一个对角矩阵,就是本定理在线性代数中的狭义情况,这个定理是研究对角化问题的最终答案。

定理:对于正规矩阵,我们可以轻松的给出下面的推论

  • 正规的三角矩阵是对角矩阵
  • 正规矩阵有nn个两两正交的单位特征向量
  • 正规矩阵有nn个不同的特征值
  • 正规矩阵不同特征值的特征向量正交
  • 对于正规矩阵,其特征值和元素满足i=1nλi2=i,j=1naij2\sum_{i=1}^n\mid\lambda_i\mid^2=\sum_{i,j=1}^n\mid a_{ij}\mid^2

正规矩阵的谱分解

我们知道正规矩阵酉相似与一个对角矩阵,这就是谱分解希望研究的

AA为正规矩阵,因此存在酉矩阵UU使得UHAU=diag(λ1,λ2,,λn)U^\mathrm{H}AU=\operatorname{diag}\left(\lambda_1,\lambda_2,\cdots,\lambda_n\right) 也就是说

A=Udiag(λ1,λ2,,λn)UH.\mathbf{A}=\boldsymbol{U}\mathrm{diag}(\lambda_1,\lambda_2,\cdots,\lambda_n)\boldsymbol{U}^\mathrm{H}.

U=(α1,α2,,αn)\boldsymbol{U}=(\boldsymbol{\alpha}_1,\boldsymbol{\alpha}_2,\cdots,\boldsymbol{\alpha}_n) 则有

A=(α1,α2,,αn)[λ1λ2λn][α1Hα2HαnH]A=(\boldsymbol{\alpha}_1,\boldsymbol{\alpha}_2,\cdots,\boldsymbol{\alpha}_n)\begin{bmatrix}\lambda_1&&&\\&\lambda_2&&\\&&\ddots&\\&&&\lambda_n\end{bmatrix}\begin{bmatrix}\boldsymbol{\alpha}_1^\mathrm{H}\\\\\boldsymbol{\alpha}_2^\mathrm{H}\\\vdots\\\boldsymbol{\alpha}_n^\mathrm{H}\end{bmatrix} =λ1α1α1H+λ2α2α2H++λnαnαnH.=\lambda_1\alpha_1\alpha_1^\mathrm{H}+\lambda_2\alpha_2\alpha_2^\mathrm{H}+\cdots+\lambda_n\alpha_n\alpha_n^\mathrm{H}.

由于λi\lambda_i是矩阵的特征值,而αi\alpha_i是特征值对应的正交单位特征向量,因此我们称为正规矩阵AA的谱分解或者特征值分解

把相同特征值的项进行整合化简可以得到

A=λ1P1+λ2P2++λsPsA=\lambda_1P_1+\lambda_2P_2+\cdots+\lambda_sP_s

单纯矩阵的谱分解

我们已知道,n,n 阶方阵当代数重复度与几何重复度相等时,称之为单纯矩阵,这样的矩阵可对角化,但不一定可以西对角化(即不一定是正规矩阵).

不过,单纯矩阵也可以类似于正规矩阵定义AA的谱分解.不妨设λ1,λ2,,λn\lambda_1,\lambda_2,\cdotp\cdotp\cdotp,\lambda_nAAnn个特征值;x1,x2,,xnx_1,x_2,\cdotp\cdotp\cdotp,x_nAAnn 个线性无关的特征向量,且有

Axi=λixi,i=1,2,,nAx_i=\lambda_ix_i,\quad i=1,2,\cdotp\cdotp\cdotp,n

P=(x1,x2,,xn),P=(x_1,x_2,\cdots,x_n), Λ=[λ1λ2λn]\boldsymbol{\Lambda}=\begin{bmatrix}\lambda_1\\&\lambda_2\\&&\ddots\\&&&\lambda_n\end{bmatrix}

A=PΛP1.A=P\Lambda P^{-1}.

两边转置有

AT=(PT)1ΛPT.A^{\mathrm{T}}=(P^{\mathrm{T}})^{-1}{\Lambda}{P}^{\mathrm{T}}.

这表明ATA^\mathrm{T}也与对角矩阵相似.因此,设y1,y2,,yny_1,y_{2},\cdotp\cdotp\cdotp,y_{n}ATA^\mathrm{T}nn个线性无关的特征向量,即

ATyi=λiyi,i=1,2,,n,\mathbf{A}^\mathrm{T}\mathbf{y}_i=\lambda_i\mathbf{y}_i\:,\quad i=1,2,\cdots,n,

把上式两端取转置得

yiTA=λiyiT,i=1,2,,n,\mathbf{y}_i^\mathrm{T}\mathbf{A}=\lambda_i\mathbf{y}_i^\mathrm{T}\:,\quad i=1,2,\cdotp\cdotp\cdotp,n,

据此,我们称yiTy_i^\mathrm{T}AA 的左特征向量,称xix_iAA的右特征向量

由此

(y1,y2,,yn)=(PT)1=(P1)T,(\mathbf{y}_1,\mathbf{y}_2,\cdots,\mathbf{y}_n)=(\mathbf{P}^\mathrm{T})^{-1}=(\mathbf{P}^{-1})^\mathrm{T},

转置得

P1=[y1TynT]\mathbf{P}^{-1}=\begin{bmatrix}\mathbf{y}_1^\mathrm{T}\\\vdots\\\mathbf{y}_n^\mathrm{T}\end{bmatrix}

代入PP1=P1P=IPP^{-1}=P^{-1}P=I

(x1,x2,,xn)[y1TynT]=[y1TynT](x1,x2,,xn)=I,(\boldsymbol{x}_1,\boldsymbol{x}_2,\cdots,\boldsymbol{x}_n)\begin{bmatrix}\boldsymbol{y}_1^\mathrm{T}\\\vdots\\\boldsymbol{y}_n^\mathrm{T}\end{bmatrix}=\begin{bmatrix}\boldsymbol{y}_1^\mathrm{T}\\\vdots\\\boldsymbol{y}_n^\mathrm{T}\end{bmatrix}(\boldsymbol{x}_1,\boldsymbol{x}_2,\cdots,\boldsymbol{x}_n)=\boldsymbol{I},

此即

x1y1T+x2y2T++xnynT=I.x_1y_1^\mathrm{T}+x_2y_2^\mathrm{T}+\cdots+x_ny_n^\mathrm{T}=I.

比较两端即有

yiTxj=δij,i,j=1,2,,n,y_i^\mathrm{T}x_j=\delta_{ij}\:,\quad i,j=1,2,\cdotp\cdotp\cdotp,n,

综上我们可以得到

A=(x1,x2,,xn)[λ1λn][y1TynT]=λ1x1y1T+λ2x2y2T++λnxnynT.A=(x_{1},x_{2},\cdots,x_{n})\begin{bmatrix}\lambda_{1}\\&\ddots\\&&\lambda_{n}\end{bmatrix}\begin{bmatrix}\mathbf{y}_{1}^{\mathrm{T}}\\\vdots\\\mathbf{y}_{n}^{\mathrm{T}}\end{bmatrix}\\=\lambda_{1}\boldsymbol{x}_{1}\boldsymbol{y}_{1}^{\mathrm{T}}+\lambda_{2}\boldsymbol{x}_{2}\boldsymbol{y}_{2}^{\mathrm{T}}+\cdots+\lambda_{n}\boldsymbol{x}_{n}\boldsymbol{y}_{n}^{\mathrm{T}}.

Gi=xiyiTG_i=x_iy_i^\mathrm{T}

即得到

A=i=1nλiGiA=\sum_{i=1}^n\lambda_i\mathbf{G}_i

这就称为单纯矩阵AA的谱分解,分解为nnGiG_i的和,线性组合的系数是AA的特征值

矩阵微积分

在线性代数中,只讨论矩阵的加(减)法、乘法和求逆为核心的代数运算,而完全没有涉及类似于数学分析中的极限、级数、微积分等运算,可是,在研究运筹学以及线性系统的可控制等方面的问题时,这些运算又是十分必要的

一类经典的的数学模型是:相当于求以矩阵UU 为自变量的函数J(U)=UαβJ( \boldsymbol{U}) = \| \boldsymbol{U}\boldsymbol{\alpha }- \boldsymbol{\beta }\|其中URm×n,αRn,βRm\boldsymbol{U}\in\mathbb{R}^m\times n,\boldsymbol{\alpha}\in\mathbb{R}^n,\boldsymbol{\beta}\in\mathbb{R}^m 在约束条件UTU=IU^\mathrm{T}U=IUUT=IUU^\mathrm{T}=I 下的最小值点(矩阵),解决此类优化问题的一个可行办法是求矩阵函数 J(U)J(U)关于未知矩阵UU 的导数,这就需要研究矩阵的微积分。

范数的定义给了我们研究距离的基础,也就赋范线性空间导出度量空间,因此本章我们研究矩阵的微积分,他是最为初等的分析学与代数学的碰撞。

向量序列与矩阵序列的极限

在研究微积分之前,我们自然还是先研究极限的问题

向量序列的极限

定义(按范数收敛):设 x(k),xCn(k=1,2,)x^{(k)},x\in\mathbb{C}^{n}(k=1,2,\cdots),若

x(k)x0,k+,\parallel x^{(k)}-x\parallel\to0,\quad k\to+\infty,

则称向量序列x(k)\langle x^(k)\rangle收敛于向量 xx,或说向量 xx 是向量序列x(k)\langle x^(k)\ranglek+k\to+\infty时的极限,可记为

limk+x(k)=x\lim_{k\to+\infty}x^{(k)}=x

x(k)x,k+.x^{(k)}\to x,\quad k\to+\infty.

根据向量范数的等价性我们可以知道:在某一向量范数下收敛,在其他范数下也收敛

定理:在Banach空间中,我们知道柯西收敛准则成立,因此此时向量收敛和其分量分别收敛是等价的 因此数学分析中该命题成立,这里我们推广到Banach空间

矩阵序列的极限

矩阵可以看作一个高维向量,因此我们可以类似的给出矩阵极限的定义,这里我们首先从分量的收敛给出定义

定义:设有矩阵序列{A(k)}\left\{A^{(k)}\right\},其中 A(k)=(aij)(k))Cn×nA^{(k)}=(a_{ij})^{(k)})\in\mathbb{C}^{n\times n},且当 k+k\to+\infty,aij(k)aij,a_{ij}^{(k)}\to a_{ij},则称{A(k)}\left\{A^{(k)}\right\}收敛,并把矩阵 A=(aij)\boldsymbol A=(a_{ij})叫做{A(k)}\left\{\boldsymbol A^{(k)}\right\}的极限,或称{A(k)}\left\{\boldsymbol A^{(k)}\right\}收敛于AA,记为

limkA(k)=AA(k)A.\lim_{k\to-\infty}A^{(k)}=A\quad\text{或}\quad A^{(k)}\to A.

不收敛的矩阵序列称为发散的.

定理:前述的矩阵收敛定义与使用矩阵范数定义是等价的,也就是等价于

A(k)A0,k+\parallel A^{(k)}-A\parallel\to0,\quad k\to+\infty

定理:和向量收敛同样的,矩阵的各个范数定义的收敛也等价

对于矩阵的极限运算,我们可以给出下面的性质

  • 线性性:设limk+A(k)=A,limk+B(k)=B\operatorname*{lim}_{k\to+\infty}A^{(k)}=A,\operatorname*{lim}_{k\to+\infty}B^{(k)}=Blimk+(aA(k)+bB(k))=aA+bB,a,bC\lim_{k\to+\infty}(a\boldsymbol{A}^{(k)}+b\boldsymbol{B}^{(k)})=a\boldsymbol{A}+b\boldsymbol{B},\quad a,b\in\mathbb{C}
  • 乘性:设limk+A(k)=A,limk+B(k)=B\operatorname*{lim}_{k\to+\infty}A^{(k)}=A,\operatorname*{lim}_{k\to+\infty}B^{(k)}=Blimk+A(k)B(k)=AB\lim_{k\to+\infty}A^{(k)}B^{(k)}=AB
  • 逆性:设limk+A(k)=A\operatorname*{lim}_{k\to+\infty}A^{(k)}=AAkA^{k}均可逆,则{(A(k))1}\{(A^{(k)})^{-1}\} 也收敛,并且limk+(A(k))1=A1\lim_{k\to+\infty}(A^{(k)})^{-1}=A^{-1}

定理:设有矩阵序列{A(k)}:A,A2,Ak,\left\{\boldsymbol{A}^{(k)}\right\}:\boldsymbol{A},\boldsymbol{A}^2,\cdotp\cdotp\cdotp A^k,\cdotp\cdotp\cdotp,则limAk=0\lim\boldsymbol{A}^k=\boldsymbol{0} 的充分必要条件是矩阵AA的所有特征值的模都小于 1,即AA的谱半径小于 1.

ρ(A)<1.\rho(A)<1.

定理 :若对于矩阵 AA 的某一范数有A<1\parallel A\parallel<1,则

limk+Ak=0.\lim_{k\to+\infty}A^k=\mathbf{0}.

矩阵级数与矩阵函数

矩阵级数的定义与收敛

为了更好的研究矩阵函数,我们首先需要研究矩阵级数理论,他和数项级数理论的定义与性质非常相似。

定义:设有矩阵序列

A(1),A(2),,A(k),,A^{(1)},A^{(2)},\cdots,A^{(k)},\cdots,

其中A(k)=(aij(k))Cn×nA^{(k)}=(a_{ij}^{(k)})\in\mathbb{C}^{n\times n},称无穷和

A(0)+A(1)+A(2)++A(k)+A^{(0)}+A^{(1)}+A^{(2)}+\cdots+A^{(k)}+\cdots

为矩阵级数,记为k=0A(k),A(k)\sum_{k=0}^{\infty}\boldsymbol{A}^{(k)},\boldsymbol{A}^{(k)}称为矩阵级数的一般项,即有

k=0+A(k)=A(0)+A(1)+A(2)++A(k)+.\sum_{k=0}^{+\infty}A^{(k)}=A^{(0)}+A^{(1)}+A^{(2)}+\cdots+A^{(k)}+\cdots.

定义:级数前k+1k+1项的和

S(k)=A(0)+A(1)+A(2)++A(k)S^{(k)}=A^{(0)}+A^{(1)}+A^{(2)}+\cdots+A^{(k)}

称为级数的部分和,如果矩阵序列S(k){S}^{(k)}收 敛 , 且有极限 SS,即有

limk+S(k)=S,\lim_{k\to+\infty}\mathbf{S}^{(k)}=S,

则称矩阵级数收敛,SS 称为级数的和,记作

S=k=0+A(k).S=\sum_{k=0}^{+\infty}A^{(k)}.

不收敛的矩阵级数称为是发散的

根据矩阵收敛的性质我们容易知道:矩阵级数收敛的充要条件是对应的n2n^2个数项级数收敛

从定义我们容易给出下面性质

  • 若 k=0+A(k) 收敛,则limk+A(k)=0;\text{若 }\sum_{k=0}^{+\infty}A^{(k)}\text{ 收敛,则}\lim_{k\to+\infty}A^{(k)}=\mathbf{0};
  • 若 k=0+A(k)=S,k=0+B(k)=S,\text{若 }\sum_{k=0}^{+\infty}\mathbf{A}^{(k)}=\mathbf{S},\sum_{k=0}^{+\infty}\mathbf{B}^{(k)}=\mathbf{S}^{\prime},\text{则} k=0+(A(k)±B(k))=S±S;\sum_{k=0}^{+\infty}(A^{(k)}\pm B^{(k)})=S\pm S^{^{\prime}};
  • 若 k=0+A(k)=S,k=0+μA(k)=μS,μC.\text{若 }\sum_{k=0}^{+\infty}A^{(k)}=S,\text{则}\sum_{k=0}^{+\infty}\mu A^{(k)}=\mu S,\mu\in\mathbb{C}.

定义:设矩阵级数 k=0A(k)=A(0)+A(1)+A(2)++A(k)+\sum_k=0A^{(k)}=A^{(0)}+A^{(1)}+A^{(2)}+\cdots+A^{(k)}+\cdots,其中 A(k)=(aij(k))Cn×n.A^{(k)}=(a_{ij}^{(k)})\in\mathbb{C}^{n\times n}.如果 n2n^2 个数项级数

aij(0)+aij(1)+aij(2)++aij(k)+,i,j=1,2,,na_{ij}^{(0)}+a_{ij}^{(1)}+a_{ij}^{(2)}+\cdots+a_{ij}^{(k)}+\cdots,\quad i,j=1,2,\cdots,n

都绝对收敛,则称矩阵级数绝对收敛

定理:矩阵级数 k=0+A(k)\sum_{k=0}^{+\infty}A^{(k)} 绝对收敛的充分必要条件是k=0+A(k)=A0+A(1)+A(2)++A(k)+\sum_{k=0}^{+\infty}\parallel A^{(k)}\parallel=\parallel A^0\parallel+\parallel A^{(1)}\parallel+\parallel A^{(2)}\parallel+\cdotp\cdotp\cdotp+\parallel A^{(k)}\parallel+\cdotp\cdotp\cdotp 收敛其中A(k)\|\boldsymbol A^(k)\|A(k)A^(k) 的任何一种范数

定理:设两个矩阵级数

A(1)+A(2)++A(k)+,A(k)Cn×n,A^{(1)}+A^{(2)}+\cdots+A^{(k)}+\cdots,\quad A^{(k)}\in\mathbb{C}^{n\times n}, B(1)+B(2)++B(k)+,B(k)Cn×nB^{(1)}+B^{(2)}+\cdotp\cdotp\cdotp+B^{(k)}+\cdotp\cdotp\cdotp,\quad B^{(k)}\in\mathbb{C}^{n\times n}

都绝对收敛,其和分别为 A,BA,B,则将它们按项相乘后作成的矩阵级数

A(1)B(1)+(A(1)B(2)+A(2)B(1))++A^{(1)}B^{(1)}+(A^{(1)}B^{(2)}+A^{(2)}B^{(1)})+\cdots+ (A(1)B(k)+A(2)B(k1)++A(k)B(1))+(A^{(1)}B^{(k)}+A^{(2)}B^{(k-1)}+\cdots+A^{(k)}B^{(1)})+\cdots

绝对收敛,且具有和AB.AB.

矩阵级数的性质

根据矩阵级数的定义以及一些分析学中的知识,我们可以展开对矩阵级数性质的研究

定理:设矩阵级数k=0+A(k)\sum_{k=0}^{+\infty}A^{(k)}绝对收敛 则

  • 级数 k=0+A(k) 收敛;\text{级数 }\sum_{k=0}^{+\infty}A^{(k)}\text{ 收敛;}
  • 级数 k=0+A(k) 在任意改变各项的次序后仍然收敛,且其和不变.\text{级数 }\sum_{k=0}^{+\infty}A^{(k)}\text{ 在任意改变各项的次序后仍然收敛,且其和不变}.

定理:设 P,QP,Qnn阶非奇异矩阵,若级数t=0A(k)\sum_{t=0}A^{(k)}收敛(或绝对收敛),则矩阵级数k=0+PA(k)Q\sum_{k=0}^{+\infty}\boldsymbol{PA}^{(k)}Q也收敛(或绝对收敛).

定义:形如

c0I+c1A+c2A2++ckAk+c_0I+c_1A+c_2A^2+\cdots+c_kA^k+\cdots

的矩阵级数称为矩阵幂级数,其中ciC,ACn×n.c_i\in\mathbb{C},A\in\mathbb{C}^n\times n.

定理:若正项级数c0I+k=1ckAk|c_0|\|\boldsymbol{I}\|+\sum_{k=1}|c_k|\|\boldsymbol{A}\|^k收敛,则矩阵幂级数 c0I+c_0\boldsymbol{I}+

c1A+c2A2++ckAk+c_{1}\boldsymbol{A}+c_{2}\boldsymbol{A}^{2}+\cdots+c_{k}\boldsymbol{A}^{k}+\cdots绝对收敛,其中A\parallel\boldsymbol{A}\parallel为矩阵 AA 的某种范数

推论:若矩阵 AA 的某一种范数A\parallel A\parallel在幂级数

k=0+c0zk=c0+c1z+c2z2++ckzk+\sum_{k=0}^{+\infty}c_0z^k=c_0+c_1z+c_2z^2+\cdots+c_kz^k+\cdots

的收敛圆内,则矩阵幂级数 k=0+ckAk\sum_{k=0}^{+\infty}c_k\mathbf{A}^k 绝对收敛.

定理:设ACn×nA\in\mathbb{C}^{n\times n},如果AA的谱半径ρ(A)\rho(\boldsymbol{A})的值在纯量zz的幂级数k=0ckzk\sum_{k=0}c_kz^k的收敛圆内,那么矩阵幂级数k=0+ckAk\sum_{k=0}^{+\infty}c_kA^k 绝对收敛;如果 AA 的特征值中有一个在幂级数k=0+ckzk\sum_{k=0}^{+\infty}c_kz^k 的收敛圆外,则矩阵幂级数k=0+ckAk\sum_{k=0}^{+\infty}c_kA^k发散.

定理:矩阵幂级数I+A+A2++Ak+I+A+A^2+\cdots+A^k+\cdots 绝对收敛的充要条件为AA的谱半径(A)<1(A)<1 且该级数的和为(IA)1\left(I-A\right)^{-1}

矩阵函数的定义

我们知道,复变量(纯量)zz 的级数

ez=1+z1!+z22!+z33!++zkk!+,sinz=zz33!+z55!+(1)kz2k+1(2k+1)!+,cosz=1z22!+z44!+(1)kz2k(2k)!+\begin{aligned}&\mathrm{e}^{z}=1+\frac{z}{1!}+\frac{z^{2}}{2!}+\frac{z^{3}}{3!}+\cdots+\frac{z^{k}}{k!}+\cdots,\\&\mathrm{sin}z=z-\frac{z^{3}}{3!}+\frac{z^{5}}{5!}-\cdots+(-1)^{k}\frac{z^{2k+1}}{(2k+1)!}+\cdots,\\&\cos z=1-\frac{z^{2}}{2!}+\frac{z^{4}}{4!}-\cdots+(-1)^{k}\frac{z^{2k}}{(2k)!}+\cdots\end{aligned}

在整个复平面都是收敛的

因此对于任意矩阵AA 矩阵幂级数

I+A1!+A22!+A33!++Akk!+,AA33!+A55!+(1)kA2k+1(2k+1)!+,IA22!+A44!+(1)kA2k(2k)!+\begin{aligned}&I+\frac{A}{1!}+\frac{A^{2}}{2!}+\frac{A^{3}}{3!}+\cdots+\frac{A^{k}}{k!}+\cdots,\\&A-\frac{A^{3}}{3!}+\frac{A^{5}}{5!}-\cdots+(-1)^{k}\frac{A^{2k+1}}{(2k+1)!}+\cdots,\\&I-\frac{A^2}{2!}+\frac{A^4}{4!}-\cdots+(-1)^k\frac{A^{2k}}{(2k)!}+\cdots\end{aligned}

都是绝对收敛的,我们记为 eA,sinA,cosAe^A,sinA,cosA

定义:设实函数 y=f(x),A,BCn×n,称 B=f(A)为矩阵 A 的函数.\text{设实函数 }y=f(x),A,B\in\mathbb{C}^{n\times n},\text{称 }B=f(A)\text{为矩阵 }A\text{ 的函数}.

对于矩阵函数,我们可以自然的给出下面的推论

  • 如果有 AB=BAAB=BAeAeB=eBeA=eA+B.\mathrm{e}^A\bullet\mathrm{e}^B=\mathrm{e}^B\bullet\mathrm{e}^A=\mathrm{e}^{A+B}.
  • 对任意矩阵 ACn×n,eA 总是可逆的(非奇异的)且(eA)1=eA.\text{对任意矩阵 }A\in\mathbb{C}^{n\times n},\mathrm{e}^A\text{ 总是可逆的(非奇异的)且(e}^A)^{-1}=\mathrm{e}^{-A}.
  • ( eA)m=emA(m为整数).(\mathrm{~e}^A)^m=\mathrm{e}^{mA}(m\text{为整数)}.

矩阵函数值的求法

直接使用定义计算矩阵函数的值是非常困难的,我们需要计算非常复杂的矩阵乘法,这里我们使用例子来介绍如果简化这种运算

已知4阶矩阵AA的特征值分别为 π,π,0,0\pi,-\pi,0,0eA,sinA,cosAe^A,sinA,cosA

因为 AA 的特征方程为

det(λIA)=(λπ)(λ+π)λ2=λ4π2λ2=0\det(\lambda\boldsymbol{I}-\boldsymbol{A})=(\lambda-\pi)(\lambda+\pi)\lambda^2=\lambda^4-\pi^2\lambda^2=0

根据哈密顿-凯莱定理 有

A4=π2A2A^4=\pi^2A^2

因此,所有大于四次的项都可以使用该定理降低阶数,整个级数内最高阶的矩阵幂就是3阶,我们可以容易计算,如下

sinA=A13!A3+15!A517!A7+19!A9=A13!A3+15!π2A317!π4A3+19!π6A3=A+(13!+15!π217!π4+19!π6)A3=A+sinπππ3A3=Aπ2A3,\begin{aligned}sinA=&\mathbf{A}-\frac{1}{3!}\mathbf{A}^{3}+\frac{1}{5!}\mathbf{A}^{5}-\frac{1}{7!}\mathbf{A}^{7}+\frac{1}{9!}\mathbf{A}^{9}-\cdots\\=&\mathbf{A}-\frac{1}{3!}\mathbf{A}^{3}+\frac{1}{5!}\pi^{2}\mathbf{A}^{3}-\frac{1}{7!}\pi^{4}\mathbf{A}^{3}+\frac{1}{9!}\pi^{6}\mathbf{A}^{3}-\cdots\\=&\mathbf{A}+\left(-\frac{1}{3!}+\frac{1}{5!}\pi^{2}-\frac{1}{7!}\pi^{4}+\frac{1}{9!}\pi^{6}-\cdots\right)\mathbf{A}^{3}\\=&\mathbf{A}+\frac{\sin\pi-\pi}{\pi^{3}}\mathbf{A}^{3}=\mathbf{A}-\pi^{-2}\mathbf{A}^{3},\end{aligned}

其余问题均可类似求解,核心是使用特征多项式带来的阶数约简 当然还有部分矩阵乘法需要计算。

另一种方法是利用一个特殊的定理,思路如下

假定矩阵AA与一个对角矩阵相似,则可以找到

C1AC=diag(λ1,λ2,,λn)C^{-1}AC=\operatorname{diag}(\lambda_1,\lambda_2,\cdots,\lambda_n)

代入公式

eA=Cdiag(eλ1,eλ2,,eλn)C1,sinA=Cdiag(sinλ1,sinλ2,,sinλn)C1,cosA=Cdiag(cosλ1,cosλ2,,cosλn)C1.\begin{aligned}&e^A=C\cdot\mathrm{diag}(\mathrm{e}^{\lambda_1},\mathrm{e}^{\lambda_2},\cdots,\mathrm{e}^{\lambda_n})\cdot C^{-1},\\&sinA=C\cdot\mathrm{diag}(\sin\lambda_1,\sin\lambda_2,\cdots,\sin\lambda_n)\cdot C^{-1},\\&cosA=C\cdot\mathrm{diag}(\cos\lambda_1,\cos\lambda_2,\cdots,\cos\lambda_n)\cdot C^{-1}.\end{aligned}

至于更加复杂的Jordan型与非三种典型函数,这里不讨论

矩阵微分与积分

函数矩阵对实变量的导数

定义:若矩阵A=(aij)A=(a_{ij})的诸元素aija_{ij}均是变量tt的函数,即

A(t)=[a11(t)a12(t)a1n(t)a21(t)a22(t)a2n(t)am1(t)am2(t)amn(t)],\mathbf{A}(t)=\begin{bmatrix}a_{11}(t)&a_{12}(t)&\cdots&a_{1n}(t)\\\\a_{21}(t)&a_{22}(t)&\cdots&a_{2n}(t)\\\vdots&\vdots&&\vdots\\\\a_{m1}(t)&a_{m2}(t)&\cdots&a_{mn}(t)\end{bmatrix},

则称A(t)\boldsymbol{A}(t)函数矩阵.推而广之,变量tt还可以是向量,也可以是矩阵

定义:如果所有的元素 aij(t)a_{ij}(t)t=t0t=t_0 时 ,存在极限,即有limtt0aij(t)=aij\operatorname* { lim} _{t\to t_0}a_{ij}\left ( t\right ) = a_{ij}, aija_{ij}为一常数,则称矩阵 A(t)A(t)有极限,且极限值为 AA(常量矩阵),即

limtt0A(t)=A=[a11a12a1na21a22a2nam1am2amn]\lim\limits_{t\to t_0}A(t)=A=\begin{bmatrix}a_{11}&a_{12}&\cdots&a_{1n}\\\\a_{21}&a_{22}&\cdots&a_{2n}\\\vdots&\vdots&&\vdots\\\\a_{m1}&a_{m2}&\cdots&a_{mn}\end{bmatrix}

一个函数矩阵的极限,具有通常函数极限的相似性质.例如,当 tt0t\to t_0 时,函数矩阵A(t)\mathbf{A}(t)B(t)B(t)有极限 AABB,则有

limtt0[A(t)+B(t)]=A+B,limtt0[A(t)B(t)]=AB,limtt0kA(t)=kA,\begin{aligned}&\operatorname*{lim}_{t\to t_{0}}[\boldsymbol{A}(t)+\boldsymbol{B}(t)]=\boldsymbol{A}+\boldsymbol{B},\\&\operatorname*{lim}_{t\to t_{0}}[\boldsymbol{A}(t)\boldsymbol{B}(t)]=\boldsymbol{A}\boldsymbol{B}\:,\\&\operatorname*{lim}_{t\to t_{0}}k\boldsymbol{A}(t)\:=\:k\boldsymbol{A}\:,\end{aligned}

其中A,BA,B均为常量矩阵,k,k为常数.

定义:如果所有函数aij(t)a_{ij}(t)在某一点或某一区间上是连续的,则称此函数矩阵在此点或在此区间上也是连续的.

对于多变量的函数矩阵,也可以有与上述类似的规定,这里就不一一重复了.

定义:设 A(t)=(aij(t))m×n\boldsymbol{A}(t)=\left(a_{ij}\left(t\right)\right)_{m\times n},若 aij(t)(i=1,2,,m;j=1,2,,n)a_{ij}\left(t\right)\left(i=1,2,\cdots,m;j=1,2,\cdots,n\right)t=t0t=t_0 处(或[a,b][a,b]上)可导,则称 A(t)\boldsymbol A(t)在点 t=t0t=t_0 处(或在[a,b][a,b]上)可导,且记为

A(t0)=dA(t)dtt=t0=limΔt0A(t0+Δt)A(t0)Δt\mathbf{A}^{'}(t_0)=\frac{\mathrm{d}\mathbf{A}(t)}{\mathrm{d}t}\mid_{t=t_0}=\lim_{\Delta t\to0}\frac{\mathbf{A}(t_0+\Delta t)-\mathbf{A}(t_0)}{\Delta t} =[a11(t0)a12(t0)a1n(t0)a21(t0)a22(t0)a2n(t0)am1(t0)am2(t0)amn(t0)]m×n.=\begin{bmatrix}a'_{11}(t_0)&a'_{12}(t_0)&\cdots&a'_{1n}(t_0)\\a'_{21}(t_0)&a'_{22}(t_0)&\cdots&a'_{2n}(t_0)\\\vdots&\vdots&&\vdots\\a'_{m1}(t_0)&a'_{m2}(t_0)&\cdots&a'_{mn}(t_0)\end{bmatrix}_{m\times n}.

下面的性质都是从数学分析中平移得到,不难证明

  • A(t)为常数矩阵的充分必要条件是 A(t)=0\mathbf{A}(t)\text{为常数矩阵的充分必要条件是 }\mathbf{A}^{\prime}(t)=\mathbf{0}
  • 设 A(t)=(aij(t))m×n与B(t)=(bij(t))m×n可导,则\text{设 }\mathbf{A}(t)=\left(a_{ij}\left(t\right)\right)_{m\times n}\text{与B}\left(t\right)=\left(b_{ij}\left(t\right)\right)_{m\times n}\text{可导,则} ddt(A(t)±B(t))=A(t)±B(t)\frac{\mathrm{d}}{\mathrm{d}t}(A(t)\pm B(t))=A^{\prime}(t)\pm B^{\prime}(t)
  • 若 k(t)是可导的实函数,A(t)可导,\text{若 }k(t)\text{是可导的实函数},A(t)\text{可导},\text{则} ddt(k(t)A(t))=k(t)A(t)+k(t)A(t)\frac{\mathrm{d}}{\mathrm{d}t}(k(t)\mathbf{A}(t))=k^{\prime}(t)\mathbf{A}(t)+k(t)\mathbf{A}^{\prime}(t)
  • 设 A(t)与 B(t)都可导,则\text{设 }A(t)\text{与 }B(t)\text{都可导,则} ddt(A(t)B(t))=A(t)B(t)+A(t)B(t)\frac{\mathrm{d}}{\mathrm{d}t}(\boldsymbol{A}(t)\boldsymbol{B}(t))=\boldsymbol{A}^{\prime}(t)\boldsymbol{B}(t)+\boldsymbol{A}(t)\boldsymbol{B}^{\prime}(t)
  • 若 A(t)与 A1(t)都有导数,则\text{若 }\mathbf{A}(t)\text{与 }\mathbf{A}^{-1}(t)\text{都有导数,则} dA1(t)dt=A1(t)A(t)A1(t)\frac{\mathrm{d}\boldsymbol{A}^{-1}(t)}{\mathrm{d}t}=-\boldsymbol{A}^{-1}(t)\boldsymbol{A}^{\prime}(t)\boldsymbol{A}^{-1}(t)
  • 设函数矩阵 A(t)\boldsymbol A(t)tt 的函数,而 t=f(x)t=f(x)xx 的实值函数.且 A(t)\boldsymbol A(t)f(x)f(x)均可导,则有dA(t)dx=dA(t)dtf(x)=f(x)dA(t)dt.\frac{\mathrm{d}\mathbf{A}(t)}{\mathrm{d}x}=\frac{\mathrm{d}\mathbf{A}(t)}{\mathrm{d}t}f'(x)=f'(x)\:\frac{\mathrm{d}\mathbf{A}(t)}{\mathrm{d}t}. 函数矩阵的导数本身也是一个函数矩阵,还可以再进行导数运算,故可以定义函数矩阵对实变量的高阶导数:
dkA(t)dtk=ddt(dk1A(t)dtk1),k=1,2,,n.\frac{\mathrm{d}^k\mathbf{A}\left(t\right)}{\mathrm{d}t^k}=\frac{\mathrm{d}}{\mathrm{d}t}\Big(\frac{\mathrm{d}^{k-1}\mathbf{A}\left(t\right)}{\mathrm{d}t^{k-1}}\Big),\quad k=1,2,\cdots,n.

我们这里给出一个简单的性质但不继续推广,他是分析学中求导公式的矩阵化体现,实际上在矩阵函数的导数问题中,降维成普通函数是更容易地。对于任何常量方阵AA

  • ddteAt=AeAt=eAtA\frac{\mathrm{d}}{\mathrm{d}t}\mathrm{e}^{\mathbf{A}t}=\mathbf{A}\mathrm{e}^{\mathbf{A}t}=\mathrm{e}^{\mathbf{A}t}\mathbf{A}
  • ddtcosAt=A(sinAt)=(sinAt)A\frac{\mathrm{d}}{\mathrm{d}t}\mathrm{cos}\boldsymbol{A}t=-\boldsymbol{A}(\sin\boldsymbol{A}t)=-(\sin\boldsymbol{A}t)\boldsymbol{A}
  • ddtsinAt=A(cosAt)=(cosAt)A.\frac{\mathrm{d}}{\mathrm{d}t}\mathrm{sin}\boldsymbol{A}t=\boldsymbol{A}(\mathrm{cos}\boldsymbol{A}t)=(\mathrm{cos}\boldsymbol{A}t)\boldsymbol{A}.

矩阵的标量函数对矩阵的导数

我们首先推广数学分析4 多元的微分与积分理论中研究得 多元数量函数对向量的导数的概念,给出矩阵数量函数对矩阵的导数的定义

定义:设ARm×n,f(A)A\in\mathbb{R}^{m\times n},f(A)为矩阵AA的数量函数,即看成是m×nm\times n元函数,则规定数量函数f(A)f(\mathbf{A})对于矩阵A\mathbf{A}的导数为

dfdA=(faij)m×n=[fa11fa1nfam1famn].\frac{\mathrm{d}f}{\mathrm{d}A}=\left(\frac{\partial f}{\partial a_{ij}}\right)_{m\times n}=\begin{bmatrix}\frac{\partial f}{\partial a_{11}}&\cdots&\frac{\partial f}{\partial a_{1n}}\\\vdots&&\vdots\\\frac{\partial f}{\partial a_{m1}}&\cdots&\frac{\partial f}{\partial a_{mn}}\end{bmatrix}.

我们这里研究的是矩阵的数量函数f(A)f(A),他不是一个矩阵函数,而是一个多元的数量函数f(A)f(A),借助下面的例子就可以理解了

X=[abcdef]\mathbf{X}=\begin{bmatrix}a&b&c\\\\d&e&f\end{bmatrix} F(X)=a2+b2+c2+d22e+15fF(X)=a^2+b^2+c^2+d^2-2e+15f 则有

dFdX=[FaFbFcFdFeFf]=[2a2b2c2d215]\frac{\mathrm{d}F}{\mathrm{d}\boldsymbol{X}}=\begin{bmatrix}\frac{\partial F}{\partial a}&\frac{\partial F}{\partial b}&\frac{\partial F}{\partial c}\\\frac{\partial F}{\partial d}&\frac{\partial F}{\partial e}&\frac{\partial F}{\partial f}\end{bmatrix}=\begin{bmatrix}2a&&2b&&2c\\2d&&-2&&15\end{bmatrix}

无论是如何计算的,但是f(A)f(A)一定是一个数量函数,否则无法从数分中自然的得到此推论

定义:设矩阵FF是以ACm×nA\in\mathbb{C}^{m\times n}为自变量的p×qp\times q矩阵,即

F(A)=f11(A)f12(A)f1q(A)f21(A)f22(A)f2q(A)fp1(A)fp2(A)fpq(A)p×q,\boldsymbol{F}(\boldsymbol{A})=\begin{vmatrix}f_{11}\left(\boldsymbol{A}\right)&f_{12}\left(\boldsymbol{A}\right)&\cdots&f_{1q}\left(\boldsymbol{A}\right)\\f_{21}\left(\boldsymbol{A}\right)&f_{22}\left(\boldsymbol{A}\right)&\cdots&f_{2q}\left(\boldsymbol{A}\right)\\\vdots&\vdots&&\vdots\\f_{p1}\left(\boldsymbol{A}\right)&f_{p2}\left(\boldsymbol{A}\right)&\cdots&f_{pq}\left(\boldsymbol{A}\right)\end{vmatrix}_{p\times q},

其元素 fk(A)f_k(\boldsymbol{A})是以矩阵 A=(aij)m×n\boldsymbol{A}=(a_{ij})_{m\times n}的元素为自变量的 mnmn 元函数,则规定矩阵 F(A)F(\boldsymbol{A})对于矩阵AA的导数为

dFdA=(Faij)pm×qn=[Fa11Fa12Fa1nFa21Fa22Fa2nFam1Fam2Famn],\frac{\mathrm{d}\boldsymbol{F}}{\mathrm{d}\boldsymbol{A}}=\:\Big(\frac{\partial\boldsymbol{F}}{\partial\:a_{ij}}\Big)_{pm\times qn}\:=\:\begin{bmatrix}\frac{\partial\boldsymbol{F}}{\partial a_{11}}&\frac{\partial\boldsymbol{F}}{\partial\:a_{12}}&\cdots&\frac{\partial\boldsymbol{F}}{\partial\:a_{1n}}\\\\\frac{\partial\boldsymbol{F}}{\partial a_{21}}&\frac{\partial\boldsymbol{F}}{\partial\:a_{22}}&\cdots&\frac{\partial\boldsymbol{F}}{\partial\:a_{2n}}\\\vdots&\vdots&&\vdots\\\\\frac{\partial\boldsymbol{F}}{\partial a_{m1}}&\frac{\partial\boldsymbol{F}}{\partial a_{m2}}&\cdots&\frac{\partial\boldsymbol{F}}{\partial\:a_{mn}}\end{bmatrix},

其中

Faij=[f11aijf12aijf1qaijf21aijf22aijf2qaijfp1aijfp2aijfpqaij],i=1,2,,m,j=1,2,,n.\frac{\partial\boldsymbol{F}}{\partial a_{ij}}=\begin{bmatrix}\frac{\partial f_{11}}{\partial a_{ij}}&\frac{\partial f_{12}}{\partial a_{ij}}&\cdots&\frac{\partial f_{1q}}{\partial a_{ij}}\\\frac{\partial f_{21}}{\partial a_{ij}}&\frac{\partial f_{22}}{\partial a_{ij}}&\cdots&\frac{\partial f_{2q}}{\partial a_{ij}}\\\vdots&\vdots&\vdots\\\frac{\partial f_{p1}}{\partial a_{ij}}&\frac{\partial f_{p2}}{\partial a_{ij}}&\cdots&\frac{\partial f_{pq}}{\partial a_{ij}}&\end{bmatrix},\begin{aligned}i&=1,2,\cdots,m,\\j&=1,2,\cdots,n.\end{aligned}

这个定义非常容易理解,虽然多层套娃但是同时囊括了前面研究的各种情况

矩阵的全微分

定义:设矩阵F=(fij)m×nF=(f_{ij})_{m\times n},则规定矩阵FF的全微分为

dF=(dfij)m×n.\mathrm{d}\boldsymbol{F}=(\mathrm{d}f_{ij})_{m\times n}.

矩阵的全微分不涉及对矩阵求导的问题,计算起来非常的自然

矩阵的全微分有下面的运算性质

  • d(F±G)=dF±dG;\operatorname{d}(\boldsymbol{F}\pm\boldsymbol{G})=\operatorname{d}\boldsymbol{F}\pm\operatorname{d}\boldsymbol{G};
  • d(kF)=kdF;\operatorname{d}(k\boldsymbol{F})=k\operatorname{d}\boldsymbol{F};
  • 当 A 是常量矩阵时 ,dA=0\text{当 }A\text{ 是常量矩阵时 },\mathrm{d}A=0
  • d(XT)=(dX)T;\operatorname{d}(\boldsymbol{X}^{\mathrm{T}})=(\operatorname{d}\boldsymbol{X})^{\mathrm{T}};
  • d(trX)=tr(dX)\operatorname{d}(\operatorname{tr}\boldsymbol{X})=\operatorname{tr}(\operatorname{d}\boldsymbol{X})

定理:设 x=(x1,x2,,xn)Tx=(x_{1},x_{2},\cdots,x_{n})^{\mathrm{T}},矩阵 F=(fij)s×mF=(f_{ij})_{s\times m},其中 fijf_{ij} 都是xix_i 的实函数,那么对于矩阵函数的全微分有

dF=i=1nFxidxi.\mathrm{d}\boldsymbol{F}=\sum_{i=1}^n\frac{\partial\boldsymbol{F}}{\partial x_i}\mathrm{d}x_i.

对于矩阵的全微分,我们可以进一步给出下面的性质

  • A=BCA=BCdA=(dB)C=BdCdA=(dB)C=BdC
  • A=A1A2...AnA=A_1A_{2}...A_ndA=(dA1)A2Ar+A1( dA2)A3Ar+A1Ar1( dAr).\mathrm{d} \boldsymbol{A}=\left(\mathrm{d} \boldsymbol{A}_{1}\right) \boldsymbol{A}_{2} \cdots \boldsymbol{A}_{r}+\boldsymbol{A}_{1}\left(\mathrm{~d} \boldsymbol{A}_{2}\right) \boldsymbol{A}_{3} \cdots \boldsymbol{A}_{r}+\boldsymbol{A}_{1} \cdots \boldsymbol{A}_{r-1}\left(\mathrm{~d} \boldsymbol{A}_{r}\right) .
  • d(αTx)=αTdx=(dx)Tαd(\alpha^Tx)=\alpha^Tdx=(dx)^T\alpha
  • d(Ax)=Adxd(Ax)=Adx
  • d(xATx)=xT(AT+A)dxd(xA^Tx)=x^T(A^T+A)dx

矩阵的积分

定义:设函数矩阵

A(t)=(a11(t)a12(t)a1n(t)a21(t)a22(t)a2n(t)an1(t)an2(t)ann(t))\boldsymbol{A}(t)=\left(\begin{array}{cccc} a_{11}(t) & a_{12}(t) & \cdots & a_{1 n}(t) \\ a_{21}(t) & a_{22}(t) & \cdots & a_{2 n}(t) \\ \vdots & \vdots & & \vdots \\ a_{n 1}(t) & a_{n 2}(t) & \cdots & a_{n n}(t) \end{array}\right)

我们定义

A(t)dt=(a11(t)dta12(t)dta1n(t)dtan1(t)dtan2(t)dtann(t)dt),abA(t)dt=(aba11(t)dtaba12(t)dtaba1n(t)dtaban1(t)dtaban2(t)dtabann(t)dt),\begin{array}{c} \int \boldsymbol{A}(t) \mathrm{d} t=\left(\begin{array}{cccc} \int a_{11}(t) \mathrm{d} t & \int a_{12}(t) \mathrm{d} t & \cdots & \int a_{1 n}(t) \mathrm{d} t \\ \vdots & \vdots & & \vdots \\ \int a_{n 1}(t) \mathrm{d} t & \int a_{n 2}(t) \mathrm{d} t & \cdots & \int a_{n n}(t) \mathrm{d} t \end{array}\right), \\ \int_{a}^{b} \boldsymbol{A}(t) \mathrm{d} t=\left(\begin{array}{cccc} \int_{a}^{b} a_{11}(t) \mathrm{d} t & \int_{a}^{b} a_{12}(t) \mathrm{d} t & \cdots & \int_{a}^{b} a_{1 n}(t) \mathrm{d} t \\ \vdots & \vdots & & \vdots \\ \int_{a}^{b} a_{n 1}(t) \mathrm{d} t & \int_{a}^{b} a_{n 2}(t) \mathrm{d} t & \cdots & \int_{a}^{b} a_{n n}(t) \mathrm{d} t \end{array}\right), \end{array}

这里显然假设积分 aij(t)dt(i,j=1,2,,n)\int a_{i j}(t) \mathrm{d} t(i, j=1,2, \cdots, n) 是存在的.

  • Title: Matrix Theory: Matrix Norms, Spectral Radius, and Hermitian Matrices
  • Author: Hyacehila
  • Created at : 2024-10-17 07:24:42
  • Link: https://hyacehila.github.io//blog/2024/10/17/matrix-theory-notes/
  • License: This work is licensed under CC BY-NC-SA 4.0.
Comments