2026 春季学期线性代数(B)所有笔记,包括从行列式到线性空间(虽说正确的学习顺序应当是反的)的所有内容以及部分梳理,内容较为杂乱(包含大量与课本无关的个人理解,包含部分 AI 生成内容,格式未统一化,实则懒得管了)且未经整理(建议丢 AI 使用,让 AI 跟你说这个神人在想什么)。期中之前都没怎么学懂以至于其中爆炸,所幸期末还是支棱起来了,以至于总评至少不难看。希望学线性代数的小宝宝们能够少走弯路,不要被毒教材(点名表扬某四字教材)害了哦~
教材丘维声《简明线性代数》(以及丘维声《高等代数(上)》)
线性代数B笔记
\(\rm I\) 线性方程组、行列式
\(\it 1.1\) 行列式基础
记 \(S=[j_1, j_2, \cdots, j_n]^T\) 为 \(1, 2,\cdots, n\) 的一个排列,\(\tau(S)\) 代表其逆序对对数。那么对 \(n\) 阶的方阵,其行列式定义为:
- \(\det(A)=|A|=\sum_{\forall S}(-1)^{\tau(S)}\prod_{i=1}^na(i, j_i)\)。
- 或者说定义一种选取方式为选出 \(n\) 个行、列互不相同的坐标 \((x_i, j_i)\),那么 \(\det(A)\) 就是这样所有的选法的 \((-1)^{\tau(x)+\tau(y)}\prod a(x_i, y_i)\) 的总和。
\(\it 1.2\) 行列式的性质
- 下三角 / 上三角行列式的值可以直接计算。
- 行列式中,行和列的地位是完全等价的,记转置矩阵为某矩阵交换行与列之后得到的矩阵,即 \(A^T\)。
- 某行 \((i, 1\sim n)\)(列同理)的值为 \(a(i, j)=kb(i, j)\),则可以将系数 \(k\) 提出来。
- 某行 \((i, 1\sim n)\)(列同理)的值为 \(a(i, j)=b(i, j)+c(i, j)\),则可以将该行的 \(b(i, j), c(i, j)\) 分到两个矩阵中分别求和。
- 互换两行,值取反。
- 某一行整体加上另一行的 \(k\) 倍,值不变。
- 因此若出现两样一模一样或者一行是另一行的 \(k\) 倍,则值为 \(0\)。
\(\it 1.3\) 代数余子式
由一个元素定义的情况
某个元素 \(a(x, y)\),将整个矩阵挖掉第 \(x\) 行与第 \(y\) 列,剩下矩阵按照原来次序组成的矩阵为 \((x, y)\) 的余子式,记为 \(M_{x, y}\)。再乘上 \((-1)^{x+y}\) 即为代数余子式,\(A_{x, y}=(-1)^{x+y}M_{x, y}\)。
【性质】
- 按某行(列同理)展开:\(\det(A)=\sum_{j=1}^na(i, j)A_{i, j}\)。
- \(\sum_{j=1}^na(i, j)A_{k, j}=0\),\(i\not=k\)。
【范德蒙德行列式】
- 满足 \(a(i, j)=a_j^{i-1}\) 的行列式成为范德蒙德行列式。
- \(\det(A)=\prod_{i\le j<i\le n}(a_i-a_j)\)。
【三对角线行列式】
- 满足 \(a(i, i)=a, a(i, i+1)=b, a(i, i-1)=c\)。
- \(\det(A)=\dfrac{\alpha^{n+1}-\beta^{n+1}}{\alpha-\beta}\) 或 \((n+1)(\dfrac a2)^2\)(\(\alpha=\beta\) 时),其中 \(\alpha, \beta\) 为 \(x^2-ax+bc=0\) 的两根。
由多个元素定义的情况
在 \(n\) 阶方阵中取 \(k\) 行 \(i_1, i_2, ..., i_k\) 与 \(k\) 列 \(j_1, j_2, ..., j_k\),它们互相交叉可以锁定 \(k^2\) 个元素,这些元素按照原有次序排列组成的新矩阵记作 \(A\dbinom{i_1, i_2, ..., i_k}{j_1, j_2, ..., j_k}\)。我们还可以定义这个新矩阵的余子式为原矩阵挖掉这 \(k\) 行 \(k\) 列之后的矩阵的值,记为 \(A\dbinom{i'_1, i'_2, ..., i'_{n-k}}{j'_1, j'_2, ..., j'_{n-k}}\)。继续乘以 \((-1)^{(i_1+...+i_k)+(j_1+...+j_k)}\) 即得到代数余子式。
【拉普拉斯定理】
- 任取 \(k\) 行(列同理)\(i_1, i_2, ..., i_k\),则在此基础上继续任选 \(j_1, j_2, ..., j_k\),则 \(\det(A)=\sum_{\{j_k\}}A\dbinom{\{i\}}{\{j\}}A\dbinom{\{i'\}}{\{j'\}}(-1)^{\sum i_t+j_t}\)。其中的 \((-1)^{\sum i_t+j_t}\) 部分按照 \(i', j'\) 计算是等价的。
- 一个简单应用:\(|A|=\begin{vmatrix}A_1 & 0\\C & A_2\end{vmatrix}=|A_1||A_2|\)。
\(\it 1.4\) 线性方程组、增广矩阵
一般矩阵 \(n\) 行 \(m\) 列,可以通过初等行变换化为:
的形式,满足第 \(i\) 行首个不为零的元素的列坐标严格单增,即阶梯矩阵。然后往回带即为简化阶梯矩阵。
【克拉默法则】
- 对于线性方程组 \(\{\sum_{j=1}^na_{ij}x_j=b_i\}_{i=1}^n\),其系数矩阵为 \(A=|a_{ij}|\)。则:
- 该方程组有唯一解的充要条件为 \(\det(A)\not=0\)。
- 若该方程组有唯一解,则 \(x_j=\dfrac{|B_j|}{|A|}\),其中 \(B_j\) 的定义是将矩阵 \(A\) 的第 \(j\) 列按顺序替换为 \(b_1\sim b_n\) 之后的新矩阵。
\(\rm II\) 向量、矩阵、秩、空间
\(\it 2.1\) 线性相关
一个向量:\(\vec\alpha_i=[a_{1i}+a_{2i}+\cdots+a_{ni}]^T\)。改写原来的线性方程组,可以得到 \(x_1\vec\alpha_1+x_2\vec\alpha_2+\cdots+x_n\vec\alpha_n=\vec\beta\),称 \(\beta\) 可以由 \(\vec\alpha_{1\sim n}\) 线性表出。
【定义】
- 线性相关:如果存在不全为 0 的系数 \(k_i\),满足 \(\sum_{i=1}^nk_i\vec\alpha_i=0\),则称向量组 \([\vec\alpha_1, \vec\alpha_2, \cdots, \vec\alpha_n]\) 线性相关;反之,则称线性无关。
- 线性无关与线性相关的关系:如果向量组的子集线性相关,则其本身线性相关;如果向量组线性无关,则其任意子集线性无关。
【推论】
- 如果向量组 \([\vec\alpha_1, \vec\alpha_2, \cdots, \vec\alpha_n]\) 线性相关 \(\Leftrightarrow\) 至少存在某一个向量 \(\vec\alpha_k\),其可以由剩余的向量线性表出。
- 判断向量组是否线性无关,只需看其对应方程组是否只有零解。
- 如果是 \(n\) 个 \(n\) 维向量,则可以通过 \(\det(A)\) 判断是否是线性无关。\(\det(A)\not=0\) 代表只有零解,线性无关。
【推论】
- 如果向量组线性无关,(说明其在高维视角下的某一个投影上满足严格线性无关)则其升维后的向量组也线性无关(维度越高,限制越严格)。
- 如果向量组线性相关,则其降维后的向量组也线性相关。
【推论】
- 如果向量组 \(\vec\alpha\) 线性无关:加入一个向量 \(\vec\beta\),线性相关 \(\Leftrightarrow\) \(\vec\beta\) 可以由 \(\{\vec\alpha\}\) 线性表出。
- 向量组内部存在互相线性表出基本上等于线性相关。
\(\it 2.2\) 极大线性无关组
极大线性无关组是极大的,且任意满足条件的都是一个固定的值。
向量组等价:能够互相线性表出。
【性质】
- 向量组与它的极大线性无关向量组等价。
- 本质上极大线性无关组满足张成的向量空间与原向量组等价,且没有冗余向量。
- 若向量组 \(\vec\alpha\) 能够表出向量组 \(\vec\beta\),则在维度上 \(\vec\beta\) 是低维的。
\(\it 2.3\) 矩阵的秩
矩阵的秩:矩阵的行向量的秩 = 矩阵列向量的秩,统称为矩阵的秩。
- 矩阵的初等行变换不改变矩阵的秩。
- 如果是 \(n\times n\) 的矩阵,其是否为满秩可以直接计算 \(\det(A)\) 得到。
- 矩阵的秩等于其不为零的子式的最高阶数。
- 子方阵秩不为 0?整个的rank至少为阶数。
【判断线性方程组是否有解】
- 充要条件:其系数矩阵 \(A\) 和增广矩阵 \(\tilde A\) 具有相同的秩。(新增一个列向量 \([b_1, b_2, \cdots, b_n]^T\),若不改变秩,则这个列向量可以由原来的向量组线性表出,也就是有解)
\(\it 2.4\) 向量空间、基、维数
- (丘砖 3.4)定义:\(U\) 是 \(K^n\) 的一个子空间,如果线性无关的向量组 \(i=1, 2, \cdots, r, \vec\alpha_i\in U\) 满足 \(U\) 中任意一个向量均可以被 \(\{\vec\alpha_i\}\) 表示出,则 \(\{\vec\alpha_i\}\) 是空间 \(U\) 的一组基。线性无关 + 都可以表出 = 基。
\(\it 2.5\) 齐次线性方程组的解集结构
\(\rm III\) 矩阵!!
先不说那些乱七八糟的证明,用直觉理解矩阵在干什么才是最重要的。
\(\it 3.1\) 矩阵到底是什么?
- 我说矩阵就是一种穿越。
- 定义:一个 \(n\times m\) 的矩阵 \(A\) 代表一种将 \(m\) 维向量 \(\mathbf x^T\) 按一定规则穿越到另一个 \(n\) 维空间的结果,相当于对 \(\mathbf x^T\) 做了一次变换,这种变换记作矩阵 \(A\),变换后的结果(\(n\) 维向量)记作 \(\mathbf y = A\mathbf x\)。
- 这种穿越具有怎样的性质?
- 对偶空间:记 \(\vec r_i\) 为矩阵 \(A\) 的行向量,\(\vec c_j\) 为矩阵 \(A\) 的列向量。行向量张成的空间为 \(\text{Row}(A)\),列向量张成的空间为 \(\text{Col}(A)\)。任意一个参与变换的向量 \(\mathbf x^T\) 一定可以被分解为 \(\mathbf x^T = \mathbf x_r^T + \mathbf x_0^T\),满足 \(\mathbf x_r^T\in\text{Row}(A)\),\(\mathbf x_0^T\) 属于行空间的正交补空间中(是这么叫吗?总之 \(\forall\mathbf y\in\text{Row}(A), \mathbf y\cdot\mathbf x_0 = 0\)),且这种分解是唯一的。
- 其中 \(\mathbf x_0^T\) 是可以舍弃的,因为这个分量在这个变换中完全不起作用。那么研究真正有用的 \(\mathbf x_r^T\),其经过矩阵变换后能得到一个确定的向量 \(\mathbf y^T\),且这种对应关系是一个双射。换句话说,只有 \(\mathbf x_r^T\) 才能变出 \(\mathbf y^T\),而 \(\mathbf y^T\) 只能由 \(\mathbf x_r^T\) 变出。
- 正因 \(\text{Row}(A)\) 和 \(\text{Col}(A)\) 中的全部向量具有一一对应关系,是一个双射,所以称其为对偶空间,它们自然拥有相同的维度数,行向量组和列向量组自然有相同的秩。
- 那么行向量和列向量在其中承担怎样的职责?
- 先看列向量:取 \(\mathbf e_j\in\text{Row}(A)\),代表行空间中的一个基底向量,那么 \(A\mathbf e_j^T\) 的结果即为矩阵 \(A\) 的第 \(j\) 列向量 \(\vec c_j\)。因此,矩阵 \(A\) 建立了 \(\vec e_j\to\vec c_j\) 的一种映射:即基向量 \(\mathbf e_j\) 按照穿越规则穿越的结果是 \(\vec c_j\)。而待处理向量 \(\mathbf x\) 可以视作 \(\text{Row}(A)\) 中所有基向量的线性组合,所以穿越结果 \(\mathbf y\) 自然是列向量组 \(\{\vec c_j\}\) 按照与 \(\mathbf x\) 相同的拼装规则拼出的结果,相当于新空间的“基底”。因此列向量描述的是穿越后会怎样。
- 再看行向量:在“矩阵乘向量”的过程中,记 \(\mathbf y = (y_1, y_2, ..., y_n)\),则 \(y_i = \mathbf x\cdot\vec r_i\)。毕竟所有 \(\vec r_i\) 是与 \(\mathbf x\) 处在同一空间中的,所以 \(\vec r_i\) 是测量 \(\mathbf x\) 的尺子:看看这个向量在 \(\vec r_i\) 上的分量是多少,决定了 \(y_i\) 的值。因此行向量描述的是对向量的测量。
- 所以,矩阵 \(A\) 本质上刻画了一个由 \(\text{Row}(A)\) 到 \(\text{Col}(A)\) 的变换,行向量作为 \(\text{Row}(A)\) 中的尺子,而列向量作为原空间基底在 \(\text{Col}(A)\) 中的映射。矩阵是对空间的一种“线性扭曲”,它是在行空间与列空间之间建立了一个对偶的桥梁,同时把无关方向舍弃。
\(\it 3.2\) 矩阵乘法到底是什么??
- 我说矩阵乘法是穿越行为的复合,能够融合两个连续的变换(以及多个)。
- 设矩阵 \(A\) 描述了空间 \(M_1\) 到 \(M_2\) 的一次穿越,矩阵 \(B\) 描述了空间 \(M_2\) 到 \(M_3\) 的一种穿越。那么矩阵 \(C=BA\) 描述的即是向量一次性完成两个变换所遵循的规则。这种复合满足结合律,即 \(B(A\mathbf x)=(BA)\mathbf x\)。
- 矩阵乘法中,行和列向量分别起什么作用?
- 列向量视角:矩阵乘法 \(C = BA\),设 \(A\) 的第 \(j\) 列向量为 \(A_{:j}\),那么矩阵 \(C\) 的第 \(j\) 列向量 \(C_{:j} = BA_{:j}\),说明 \(C_{:j}\) 是 \(A_{:j}\) 按照 \(B\) 的穿越规则变换后得到的结果,相当于是从空间 \(M_2\) 到 \(M_3\) 的一种变换。再取 \(M_1\) 中的基向量 \(\mathbf e_j\),连续的映射关系即为 \(\mathbf e_j\to A_{:j}\to C_{:j}\)。此时,矩阵乘法完成了对列向量映射关系的合并。
- 行向量视角:想象单位矩阵 \(I\),其含义可视为一个向量“变成自己的变换”,其中的行向量 \((0, 0, ..., 0, 1, 0, ..., 0)\) 可以视为一个空间“度量自己”的尺子(点乘后得到自己的分量)。考虑一个存在于 \(M_3\) 中的行向量 \(\mathbf x=(0, 0, ..., 0, 1, 0, ..., 0)\),我们一步一步将其“拉回” \(M_1\) 中,让它去测量 \(M_1\) 中的向量。首先计算 \(\mathbf y = \mathbf xB\),此时的尺子 \(\mathbf y\) 即为 \(B\) 对应行的行向量 \(B_{i:}\),说明 \(\mathbf x\) 在 \(M_3\) 和 \(\mathbf y\) 在 \(M_2\) 发挥了一样的测量作用,可以视为一样的尺子。然后乘上 \(A\),得到 \(\mathbf z = \mathbf yA\),此时 \(\mathbf z\) 为 \(M_1\) 中的尺子向量,发挥与 \(\mathbf x\) 一样的作用。综合所有的单位矩阵的行向量 \(\mathbf x = I_{i:}\),得到最后的复合变换形式:\(C=IBA=BA\)。
- 一句话:尺子前往 \(M_1\),留在过去;映射前往 \(M_3\),去往未来。(行向量通过右乘矩阵回溯到原空间,列向量通过左乘矩阵前进到像空间。)
- 再说矩阵乘法的分配率:其表示“尺子”的度量是满足可加性的,用 \(\mathbf x\) 度量和用 \(\mathbf y\) 度量的结果的和就是直接用 \(\mathbf x+\mathbf y\) 度量的结果。
\(\it 3.3\) 矩阵的变换:转置、行列式、逆
【矩阵的转置】
- 相当于交换尺子和映射,倒转变换方向。尺子变成映射,映射变成尺子,二者具有等价的地位。
- 有 \(\mathbf y\cdot(A\mathbf x) = (A^T\mathbf y)\cdot\mathbf x\) 恒等式。
- 也就是说,\(A\) 与 \(A^T\) 这两个矩阵描述了两个同构空间的变换关系,其中的向量不仅具有双射的关系,还具有更精确的代数描述。
- 不过需要注意的是,矩阵 \(A\) 的变换往往具有拉伸原向量 \(\mathbf x\) 的效果,这换到 \(A^T\) 中仍然保留了对向量的拉伸效果,所以矩阵 \(AA^T\) 不能得到原来的向量,而是得到同一空间 \(\text{Row}(A)\) 中被拉伸两遍的向量(换言之,看矩阵 \(A\) 的输出能力)。
【矩阵的行列式】
- 对于方阵,\(\det(AB) = \det(A)\cdot\det(B)\)。
- 对于 \(A_{s\times n}\) 和 \(B_{n\times s}\),若 \(s>n\),则 \(AB\) 不是满秩矩阵,\(\det(AB) = 0\);否则 \(\det(AB) = \sum\limits_{1\le i_1<i_2<...<i_s\le n}\det A\dbinom{1, 2, ..., s}{i_1, i_2, ..., i_s}\cdot\det B\dbinom{i_1, i_2, ..., i_s}{1, 2, ..., s}\)。
【可逆矩阵】
- 方阵可逆的充要条件:\(\det(A)\not=0\)。
- 伴随矩阵 \(\text{adj}(A)(i, j)=A_{ji}\),注意是将 \(a_{ij}\) 替换为代数余子式 \(A_{ij}\) 再转置的结果。满足 \(A\cdot \text{adj}(A)=\det(A)I\)。
- 性质:
- \(A\) 可逆,则 \(A^{-1}\) 也可逆,且 \((A^{-1})^{-1}=A\),即可逆是相互的。
- \((AB)^{-1}=B^{-1}A^{-1}\)。
- 若 \(A\) 可逆,则 \(A^T\) 也可逆,且 \((A^T)^{-1} = (A^{-1})^T\)。
- 可逆矩阵相当于从 \(I\) 出发,左乘一系列初等矩阵(相当于初等行变换),得到的结果,这保证了 \(\text{rank}(A)=n\)。这是充要的。
- 如果对 \(A\) 进行一系列初等行变换得到了 \(I\),即 \(P_tP_{t-1}...P_2P_1A=I\),则对 \(I\) 进行同样的操作就可以得到 \(A^{-1}\),即 \(A^{-1}=P_tP_{t-1}...P_2P_1I=P_tP_{t-1}...P_2P_1=(P_1P_2...P_t)^{-1}\)。
\(\it 3.4\) 矩阵分块
矩阵分块:将矩阵乘法中的 \(A=BC\) 中的每个单位元素改写为一个子矩阵,满足同行、列子矩阵的宽度是一致的。注意 \(A\) 的列方向矩阵宽度分布一定要和 \(B\) 的行方向矩阵宽度分布是一样的。那么 \(A=BC\) 完全可以按照普通矩阵乘法的步骤进行计算。
【分块矩阵初等行列变换】
- 操作1:互换两个行块的位置。互换两个列块的位置。
- 操作2:某行同时左乘某个可逆矩阵,某列右乘一个矩阵。
- 操作3:某行同时加上另一行左乘 \(P\) 的结果,某一列同时加上另一列右乘 \(P\) 的结果。
单位矩阵分块得到的矩阵经过依次初等行、列变换得到的矩阵称为分块初等矩阵。
\(\it 3.5\) 正交矩阵
- 定义:满足 \(AA^T=I\) 的矩阵。
- 向量正交化(是一种变换)
\(\rm IV\) SVD视角下的转置与逆
在前面的讨论中,我们将矩阵理解为一种“穿越”(线性变换)。而要真正理解转置 \(A^T\) 与逆 \(A^{-1}\) 的区别,本质上需要借助奇异值分解(SVD)。
\(\it 4.1\) SVD:矩阵的本质结构
任意矩阵 \(A \in \mathbb{R}^{n\times m}\) 都可以分解为:
其中:
- \(U \in \mathbb{R}^{n\times n}\):正交矩阵(输出空间的正交基)
- \(V \in \mathbb{R}^{m\times m}\):正交矩阵(输入空间的正交基)
- \(\Sigma \in \mathbb{R}^{n\times m}\):对角矩阵(奇异值)
【结构理解】矩阵 \(A\) 的作用可以拆解为三步:
- \(V^T\):将输入向量 \(\mathbf x\) 表达在一组“最适合被拉伸的正交基”上
- \(\Sigma\):沿各个方向独立拉伸(不发生混合)
- \(U\):将结果映射到输出空间
【一句话总结】矩阵 \(A\) = 换坐标(\(V^T\)) + 拉伸(\(\Sigma\)) + 再换坐标(\(U\))
\(\it 4.2\) 转置 \(A^T\) 的本质
对 SVD 取转置:
【结构对比】
| 矩阵 | 分解形式 | 作用顺序 |
|---|---|---|
| \(A\) | \(U \Sigma V^T\) | \(V^T \mathbb Rightarrow \Sigma \mathbb Rightarrow U\) |
| \(A^T\) | \(V \Sigma U^T\) | \(U^T \mathbb Rightarrow \Sigma \mathbb Rightarrow V\) |
【核心结论】转置 \(A^T\) 的作用是:交换 SVD 中前后两个正交变换,而保持中间的拉伸 \(\Sigma\) 不变。
【直观理解(升级版)】
- \(A\):在“输入坐标系 \(V\)”中拉伸,再映射到“输出坐标系 \(U\)”
- \(A^T\):在“输出坐标系 \(U\)”中拉伸,再映射回“输入坐标系 \(V\)”
- \(A\) 决定“如何拉伸”,\(A^T\) 决定“在哪个坐标系中看这个拉伸”。
\(\it 4.3\) 为什么 \(A^T \neq A^{-1}\)?
利用 SVD:
【关键区别】
| 操作 | 拉伸部分 |
|---|---|
| \(A^T\) | \(\Sigma\)(保持原拉伸) |
| \(A^{-1}\) | \(\Sigma^{-1}\)(完全反向拉伸) |
【本质解释】
- \(A^T\):不改变拉伸强度,仅交换坐标系
- \(A^{-1}\):彻底“撤销”拉伸(恢复原状)
【结论】转置不会“反转变换”,它只是重新表达同一套拉伸结构;只有逆矩阵才真正撤销变换。
\(\it 4.4\) 正交矩阵的特殊情况
若:
则:
【含义】
- 所有奇异值 \(\sigma_i = 1\)
- 不发生拉伸,仅发生旋转/反射
【结论】当矩阵不改变长度和角度时(纯旋转/反射),转置等于逆。
\(\it 4.5\) 关于 \(A^T A\) 与 \(AA^T\)
由 SVD 可得:
【结构解释】
- \(A^T A\):在输入空间(Row)中进行拉伸
- \(AA^T\):在输出空间(Col)中进行拉伸
【本质】
它们消除了“旋转”,只保留“拉伸结构”。
【几何意义】
- 特征向量:主方向(\(V\) 或 \(U\))
- 特征值:拉伸强度的平方(\(\sigma_i^2\))
【一句话总结】
\(A^T A\) 和 \(AA^T\) 是“只反映拉伸本质”的算子,它们刻画了矩阵对空间结构的扭曲程度。
\(\it 4.6\) 终极理解总结
- \(A\):改变向量的位置(穿越)
- \(A^T\):交换输入/输出坐标系(保持拉伸不变)
- \(A^{-1}\):完全撤销变换(反向拉伸)
- \(\Sigma\):唯一决定“数值放缩”的部分
🔥 最终一句话(强烈推荐记住):
矩阵的本质是“沿特定方向的拉伸”,而转置只是改变观察这组拉伸的坐标系。
线性代数(B) Part. 2
\(\rm V\) 矩阵的相抵与相似
\(\it 5.1\) 集合划分与等价关系、矩阵的相抵
设想一个完全图 \(G = (V, E)\),其中 \(E = \{(u, v)|\forall u, v\in V\}\)(允许自环)。那么一个二元关系就是边集的一个子集 \(W\subseteq E\)。如果一个二元关系是一个等价关系,当且仅当其能被表示为原图的若干个团,且所有团的点的并集为 \(V\)。
- 换言之,\(V = \bigcup\limits_{i=1}^mV_i\) 且 \(\forall i\not=j, V_i\cap V_j=\varnothing\)。则 \(W = \bigcup\limits_{i=1}^m\{(a, b)|a, b\in V_i\}\)。
按照这个逻辑,设想 \(V = \mathbf M_{s\times k}\) 为数域 \(K\) 上的所有 \(s\times k\) 矩阵,若两个矩阵 \(A, B\) 能经过一系列初等行、列变换相互变形,则称 \(A, B\) 相抵。相抵关系是一种等价关系。\(A\) 与 \(B\) 相抵的充要条件为其有相同的秩。因为任意一个矩阵 \(A\) 总是能够通过初等变换化为标准型:
且是先只做初等行变换,再只做初等列变换。又由于一系列初等行变换可以写成满秩矩阵左乘的形式,一系列初等列变换可以写成满秩矩阵右乘的形式,所以任意矩阵 \(A\) 可以写成 \(A=PNQ\),其中 \(P, Q\) 代表初等变换,\(N\) 为标准型。
\(\it 5.2\) 广义逆矩阵与伪逆
用简洁的公式描述 \(A\mathbf x=\beta\) 的所有解?
"广义逆"的最低限度:在 \(\text{Row}\) 和 \(\text{Col}\) 之间建立双射关系,任意一个 \(A_{m\times n}\) 的广义逆 \(X\),至少要满足 \(\forall\mathbf x\in\text{Row}(A)\),\(XA\mathbf x=\mathbf x\)。这个表达式在代数上等效于 \(AXA=A\)。其中 \(X\) 的通解为:(\(n\times m\))
这样的任意一个 \(X\) 记作 \(A\) 的广义逆 \(A^-\)。
那么:方程 \(A\mathbf x=\beta\) 有解的充要条件为 \(\beta\in\text{Col}(A)\),用代数语言表示即:\(\beta=AA^-\beta\),这能保证 \(\beta\) 完全没有左零空间的分量。那么 \(A\mathbf x=\beta\) 的通解即 \(\mathbf x_r=A^-\beta\) 加上任意一个 \(\text{Nul}(A)\) 中的向量。
记矩阵 \(\begin{pmatrix}I_r & B\\C & D\end{pmatrix}=N\)。
首先研究 \(P, Q, P^{-1}, Q^{-1}\) 的性质:
- \(P\) 的前 \(r\) 列向量张成 \(\text{Col}(A)\)。
- 考虑 \(A=PNQ\),其中 \(PN\) 这个矩阵运算的结果是保留 \(P\) 的前 \(r\) 列,其余部分压扁为 0,而右乘一个 \(Q\) 代表做若干初等列变换,这不改变当前的列空间,故 \(\text{Col}(A) = \text{Col}(PNQ)=\text{Col}(PN)=\text{Col}(\textsf{First }r\textsf{ columns of }P)\)。
- \(P\) 的后 \(m-r\) 列向量张成 \(\text{Nul}(A^T)\)。
- 因为 \(P\) 为满秩矩阵,故 \(\text{Col}(P) = \mathbb R^m\),而前 \(r\) 列张成 \(\text{Col}(A)\),剩下的依然为无关的线性向量组且与 \(\text{Col}(A)\) 无交,故结果为 \(\text{Nul}(A^T)\)。
- \(Q\) 的前 \(r\) 行向量张成 \(\text{Row}(A)\)。
- \(Q\) 的后 \(n-r\) 列向量张成 \(\text{Nul}(A)\)。
- \(P^{-1}\) 的前 \(r\) 行向量张成 \(\text{Col}(A)\),后 \(m-r\) 行向量张成 \(\text{Nul}(A^T)\)。
- 计算 \(P^{-1}P = I\),记 \(P^{-1}\) 的行向量为 \(\mathbf a_1\sim \mathbf a_m\),\(P\) 的列向量为 \(\mathbf b_1\sim\mathbf b_m\),则对于任意 \(i\in[r+1, m], j\in [1, r]\),均有 \(\mathbf a_i\cdot\mathbf b_j=0\),故这两个空间正交,而与 \(\text{Col}(A)=\text{span}\langle\mathbf b_1\sim \mathbf b_r \rangle\) 正交的空间即 \(\text{Nul}(A^T)\)。自然前 \(r\) 行张成的空间为 \(\text{Col}(A)\)。
- \(Q^{-1}\) 的前 \(r\) 列向量张成 \(\text{Row}(A)\),后 \(n-r\) 列向量张成 \(\text{Nul}(A)\)。
然后考察对任意一个 \(\mathbf y\in\mathbb R^m\),\(X\mathbf y=Q^{-1}NP^{-1}\mathbf y\) 的性质:
- 先算 \(P^{-1}\mathbf y\),已知 \(P^{-1}\) 的前 \(r\) 行为 \(\text{Col}(A)\),剩余为 \(\text{Nul}(A^T)\),按照这两个空间正交分解 \(\mathbf y=\mathbf y_r+\mathbf y_0\)。那么 \(P^{-1}\mathbf y_r\) 的后 \(m-r\) 个分量都为 \(0\)(因为 \(\mathbf y_r\) 与左零空间中的向量相乘结果为 \(0\)),同理 \(P^{-1}\mathbf y_0\) 的前 \(r\) 个分量为 \(0\)。
- 将 \(P^{-1}\mathbf y=P^{-1}(\mathbf y_r+\mathbf y_0)\) 写成 \(\begin{pmatrix}y_1\\y_2\end{pmatrix}\) 的形式,其中 \(y_1\) 为 \(\mathbf y_r\) 的结果,\(y_2\) 为 \(\mathbf y_0\) 的结果。
- 计算 \(NP^{-1}\mathbf y=\begin{pmatrix}I_r & B\\C & D\end{pmatrix}\dbinom{y_1}{y_2}=\dbinom{y_1+By_2}{Cy_1+Dy_2}\)。记 \(\mathbf z_1=\dbinom{y_1}{Cy_1}, \mathbf z_2=\dbinom{By_2}{Dy_2}\)。
- 重点考察 \(\mathbf z_1=\dbinom{y_1}{Cy_1}\),最后一步将其乘上 \(Q^{-1}\)。已知 \(Q^{-1}\) 的性质是前 \(r\) 列为 \(\text{Row}(A)\),那么 \(\mathbf z_1\) 的前 \(r\) 个分量为 \(\dbinom{y_1}0=NP^{-1}\mathbf y_r\) 的去掉 \(Cy_1\) 的部分。以 \(Q^{-1}\) 的前 \(r\) 列为输出向量,得到的结果是 \(y_1\) 部分对应分量倍数的 \(Q^{-1}\) 前 \(r\) 个向量的线性组合,因此 \(Q^{-1}NP^{-1}\dbinom{y_1}0\in\text{Row}(A)\),且正好是 \(\mathbf x_r\)!
- 所以其他部分:\(Cy_1\) 将 \(\mathbf y_r\) 映射到 \(\text{Nul}(A)\) 中有一个分量,\(By_2\) 和 \(Dy_2\) 分别将 \(\mathbf y_0\) 映射到 \(\text{Row}(A)\) 和 \(\text{Nul}(A)\) 中的分量。
鉴于矩阵 \(N\) 中的 \(B, C, D\) 部分可以任意地取,所以其中 \(Cy_1\) 的分量也就是 \(\mathbf y_r\) 映射到 \(\text{Nul}(A)\) 中的分量可以任意的去,而 \(\mathbf y_r\) 映射到 \(\text{Row}(A)\) 中的分量始终为 \(\mathbf x_r\),故这个组合可以取到所有的 \(\mathbf x=\mathbf x_r+\mathbf x_0\),其中 \(\forall \mathbf x_0\in\text{Nul}(A)\)。故方程 \(A\mathbf x=\beta\) 的所有解为:\(\mathbf x=A^-\beta\),其中 \(A^-\) 取遍所有可能的合法广义逆矩阵。
推广:
- 方程 \(A\mathbf x = 0\) 的所有解为:任取一个合法的广义逆矩阵 \(A^-\) 和任意的 \(\mathbf z\in\mathbb R^n\),则 \(\mathbf x_0 = (I_n-A^-A)\mathbf z\) 为方程 \(A\mathbf x = 0\) 的通解。
- 如果只知道矩阵 \(A\) 的任意一个广义逆 \(A^-\),也可以通过 \(\mathbf x = A^-\beta + (I_n-A^-A)\mathbf z\) 的方式写出方程 \(A\mathbf x = \beta\) 的通解,其中 \(\mathbf z\) 取遍所有 \(\mathbb R^n\) 中的向量。
【伪逆】
- 对于广义逆的一般形式 \(A=PNQ, X = Q^{-1}\begin{pmatrix}I_r & B\\C & D\end{pmatrix}P^{-1}\),当 \(B, C, D\) 都为零矩阵的时候,称此时的 \(X\) 为矩阵 \(A\) 的伪逆,记作 \(A^+\)。定义上,若复数域上的 \(A=\mathbf M_{s\times k}\) 满足 \(\begin{cases}AXA = 0\\XAX = 0\\(AX)^* = AX\\(XA)^* = XA\end{cases}\),则称这个方程组的唯一解为伪逆 \(A^+\)。
\(\it 5.3\) 矩阵的相似
定义上,对于 \(n\) 阶方阵 \(A, B\),如果存在可逆矩阵 \(P\) 满足 \(P^{-1}AP = B\),则称 \(A, B\) 为相似矩阵。
- 如何理解相似?即:矩阵代表的变换在不同基意义的坐标下的展示。如在标准基下定义一个变换 \(B\),此时在空间中有一组新的基 \(\mathbf y_1\sim\mathbf y_n\),满秩矩阵 \(P\) 代表将一个数值为 \(\mathbf y\) 中的坐标变换为数值为标准基坐标的一个矩阵,那么考虑如何重写矩阵 \(B\) 的变换:首先将标准基意义下的坐标替换为 \(\mathbf y\) 意义下,即左乘 \(P^{-1}\),然后执行在 \(\mathbf y\) 坐标意义下的变换 \(A\),最后变回标准基,乘 \(P\),综合即 \(B=PAP^{-1}\)。
- 而且注意相似关系与相抵关系是一个严格的class。
定义矩阵的迹 trace:\(\text{tr}(A)=\sum\limits_{i=1}^na_{ii}\)。代表矩阵 \(A\) 特征值之和,但是我现在还看不懂,不过看着就很有用。
一些矩阵 trace 的性质:
- \(\text{tr}(A+B)=\text{tr}(A)+\text{tr}(B)\);
- \(\text{tr}(kA)=k\text{tr}(A)\);
- \(\text{tr}(AB)=\text{tr}(BA)\)。
【可对角化】
- 如果一个矩阵 \(A\) 能相似于一个对角矩阵 \(\text{diag}(\lambda_1\sim\lambda_n)\),则称 \(A\) 可对角化。其充要条件是:存在 \(n\) 个线性无关的列向量 \(\mathbf a_1\sim\mathbf a_n\) 和 \(n\) 个系数 \(\lambda_1\sim\lambda_n\) 满足 \(A\mathbf a_i=\lambda_i\mathbf a_i\)。此时 \(P = (\mathbf a_1\sim \mathbf a_n)\) 即满足 \(P^{-1}AP=\text{diag}\{\lambda_1\sim\lambda_n\}\)。
- 称 \(\lambda_i\) 为 \(A\) 的一个特征值,\(\mathbf a_i\) 为对应 \(\lambda_i\) 的一个特征向量。零向量不是特征向量。
- 求解特征值与特征向量:\(A\mathbf a_i=\lambda_i\mathbf a_i\) 即 \((\lambda_iI-A)\mathbf a_i=0\),为求解 \(\mathbf a_i\) 的值(非零)则需要 \(|\lambda_iI-A|=0\),此时才有非零解。定义 \(f(\lambda)=|\lambda I-A|\) 为特征多项式,其所有根即为特征值,对应的解为特征向量。对于每个特定的特征值 \(\lambda\),其所有 \((\lambda I - A)\mathbf x=0\) 的解构成有关 \(\lambda\) 的特征子空间。即:\(E_{\lambda_i} = \text{Nul}(\lambda_iI - A)\)。任意两个 \(E_{\lambda_i}, E_{\lambda_j}\) 满足直和分解性质。
- 特征多项式的性质:设 \(A\) 是 \(n\) 级矩阵,其特征多项式满足:\(f(\lambda)=|\lambda I-A| = \sum\limits_{k=0}^nv_k\lambda^k\),其中 \(v_n=1, v_{n-1}=-\text{tr}(A), v_0=(-1)^n|A|\),且 \(v_{n-k}\) 为 \(A\) 的所有 \(k\) 阶主子式的和乘以 \((-1)^k\)。
- 若 \(A\) 有一个特征值 \(\lambda\),把 \(\lambda\) 对应的特征子空间的维数称为 \(\lambda\) 的几何重数,把 \(\lambda\) 作为特征多项式的根的重数为代数重数,则:几何重数不超过代数重数。
- 相似的矩阵具有相同的特征值、特征多项式。
- 【相似标准型】若存在对角矩阵 \(\text{diag}\) 使得 \(A\sim\text{diag}\),那么 \(\text{diag} = \{\lambda_1\sim\lambda_n\}\) 即为矩阵 \(A\) 的相似标准型。任意一个矩阵 \(A\) 若可对角化,那么其相似标准型在不考虑 \(\lambda_1\sim\lambda_n\) 顺序的情况下是唯一的。
- 矩阵 \(A\) 可对角化的充要条件是:\(A\) 的所有特征子空间构成 \(\mathbb K^n\) 的一组直和分解。
【实对称矩阵的特殊性质】
-
正交对角化
实对称矩阵 \(A\) 必可正交对角化:存在正交矩阵 \(Q\)(\(Q^{-1}=Q^T\))与实对角矩阵 \(\Lambda\),使得\[Q^T A Q = \Lambda = \operatorname{diag}(\lambda_1,\dots,\lambda_n) \]对角元 \(\lambda_i\) 是 \(A\) 的特征值(均为实数)。
-
特征值与特征多项式
特征多项式 \(\det(\lambda I - A)\) 的 \(n\) 个根(按重数计)全是实数。
不同特征值对应的特征子空间彼此正交。 -
特征子空间
对每个特征值 \(\lambda\),特征子空间 \(E_\lambda = \operatorname{Nul}(A-\lambda I)\)。
\(\dim E_\lambda = \lambda\) 的代数重数(几何重数 = 代数重数)。
\(\mathbb{R}^n\) 可分解为各特征子空间的正交直和:\[\mathbb{R}^n = E_{\lambda_1} \oplus E_{\lambda_2} \oplus \dots \oplus E_{\lambda_k} \]且不同 \(E_{\lambda_i}\) 之间互相正交。
-
相似与正交相似
实对称矩阵之间的相似关系等价于正交相似关系。
若两个实对称矩阵有相同的特征值(计重数),则它们必正交相似,即存在正交矩阵 \(Q\) 使 \(Q^T A Q = B\)。 -
与其他矩阵类对比
- 一般实方阵:不一定可对角化,不一定特征值实数。
- 实对称矩阵:可正交对角化,特征值实数。
- 正交矩阵:在复数域可对角化,特征值模长为1,不一定实对称。
- 正规矩阵:可酉对角化,但不一定是实对称。
\(\it 5.N\) 若尔当标准形:几何直觉与代数结构(意外的发现)
从三种基本操作出发
- 纯伸缩:沿着某个方向(一维不变子空间)按比例 \(\lambda\) 拉长或压缩,对应实数特征值。
- 旋转(可能带伸缩):在某个平面(二维不变子空间)内转动并均匀缩放,对应一对共轭复特征值 \(a\pm bi\),实数域上表现为 \(2\times2\) 实块 \(\begin{pmatrix}a & -b \\ b & a\end{pmatrix}\)。
- 剪切(链式拖动):一个方向被另一个方向“拉动”,并且这种拉动可以逐级传递,形成一条链。例如二维剪切 \(\begin{pmatrix}1 & 1 \\ 0 & 1\end{pmatrix}\) 把竖直线推斜,且没有足够多的特征向量。
为什么需要若尔当块?
- 实数特征值只能捕捉纯伸缩(一维),复特征值对只能捕捉平面上的旋转+伸缩(二维)。
- 但剪切操作中,一个特征值对应的特征向量只有一条(几何重数=1),而它占用的维度(代数重数)可能大于1。例如 \(\begin{pmatrix}\lambda & 1 \\ 0 & \lambda\end{pmatrix}\) 的特征值 \(\lambda\) 的代数重数为2,几何重数为1。
- 这意味着:仅仅用特征向量无法张成整个空间,需要引入广义特征向量来补充缺失的维度。
若尔当块(Jordan block)
- 一个 \(k\) 阶若尔当块(对应特征值 \(\lambda\))具有形式:\[J_k(\lambda) = \begin{pmatrix} \lambda & 1 & 0 & \cdots & 0 \\ 0 & \lambda & 1 & \cdots & 0 \\ \vdots & \vdots & \ddots & \ddots & \vdots \\ 0 & 0 & \cdots & \lambda & 1 \\ 0 & 0 & \cdots & 0 & \lambda \end{pmatrix} \]
- 它描述 “伸缩 \(\lambda\) 倍 + 长度为 \(k\) 的剪切链”:
- 第一个基向量是普通特征向量(方向不变)。
- 第二个基向量被映射为 \(\lambda\cdot\) 自身 + 第一个基向量(被第一个方向拖动)。
- 第三个基向量被映射为 \(\lambda\cdot\) 自身 + 第二个基向量,以此类推。
- 整个 \(k\) 维子空间是不可再分解的不变子空间。
若尔当标准形(Jordan canonical form)
- 在复数域上,任何方阵都相似于一个由若尔当块组成的块对角矩阵:\[A \sim \begin{pmatrix} J_{k_1}(\lambda_1) & & \\ & J_{k_2}(\lambda_2) & \\ & & \ddots \end{pmatrix} \]
- 每个若尔当块对应一个特征值(实数或复数),块的大小等于该特征值的代数重数。
- 若尔当标准形将整个空间分解为若干独立的不变子空间(每个子空间对应一个若尔当块),在这些子空间上变换就是“伸缩+剪切”(或“旋转+伸缩”),块之间互不干扰。
实数域上的处理
- 实数矩阵的复特征值成对出现,对应的若尔当块在实数域上表现为 实若尔当块:\[\begin{pmatrix} R & I_2 & & \\ & R & I_2 & \\ & & \ddots & I_2 \\ & & & R \end{pmatrix} ,\quad R = \begin{pmatrix}a & -b \\ b & a\end{pmatrix} \]其中 \(I_2\) 是二阶单位矩阵。这代表了“旋转+伸缩”与“平面之间的剪切”的复合。
总结
- 特征值/特征向量 只能描述纯伸缩(实数)和旋转+伸缩(复共轭对)。
- 剪切 需要更多维度来描述一个特征值,由此产生了若尔当块。
- 若尔当标准形 将任意线性变换分解为若干个独立的“伸缩+剪切”原子操作(若尔当块)的直和,从而彻底揭示了变换的内在不变量。
从几何直觉看:若尔当块就是“剪切链”的代数化身。当你看到一个不可对角化的矩阵时,你就在观察一条或多条这样的链。
线性代数(B)笔记 Part 3.
\(\rm VI\) 二次型 · 矩阵的合同
\(\it 6.1\) 二次型与矩阵合同
【定义】
-
设 \(A, B\) 为 \(n\) 阶实对称矩阵,若存在可逆矩阵 \(P\) 使 \(B=P^TAP\),则称 \(A\) 与 \(B\) 合同,记作 \(A \cong B\)。本质上,合同刻画 同一个二次型(或对称双线性形式)在不同基下的度量矩阵,记变换基底 \(\mathbf x=P\mathbf y\)。
-
由于实对称矩阵一定存在 \(n\) 个正交的特征向量,所以如果 \(C^TAC=\Lambda\)(对角矩阵),那么 \(C\) 这个变换一定是基于 \(A\) 的 \(n\) 个特征向量的方向的,放缩倍数随意(非零即可)。
-
注意:在实数域上,因为乘了两遍 \(C\) ,所以有关实二次型的凹、凸、平的方向个数不改变,可以理解为高维圆锥曲线的 \(n\) 个方向中,有多少个方向是椭圆特征,有多少个方向是双曲特征,有多少方向是柱面特征(平的)是不由合同改变的。
-
因此,两个矩阵合同的充要条件是具有相同的惯性指数 \(p, q\)。合同只关心这个。
-
任意的实对称矩阵一定存在正交矩阵 \(Q\) 使得 \(Q^TAQ=\text{diag}(\lambda_1, ..., \lambda_n)\),其中 \(\lambda_i\) 为特征值。
-
在复数域上,任何对称矩阵 \(A\)(\(A^T = A\))都合同于 \(\begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}\),其中 \(r = \operatorname{rank}(A)\)。原因:复数域允许开平方,正负号可通过缩放变成 1;因此惯性指数退化为秩。
【合同变换的常用方法】
- 配方法:通过配方将二次型化为平方和,直接得到合同变换矩阵(通常为上三角)。
- 正交变换法:利用特征向量构造正交矩阵,得到正交合同标准形(特征值对角阵)。
\(\it 6.2\) 正定矩阵
【概念】
- 称一个二次型 \(\mathbf x^TA\mathbf x\) 是正定的,当且仅当 \(\mathbf x^TA\mathbf x>0\) 对 \(\forall\mathbf x\in\mathbb R^n\) 成立。同时将此时的 \(A\) 称为正定矩阵。
- \(A\) 是正定矩阵,当且仅当 \(A\) 的正惯性指数为 \(n\),也就是说 \(A\) 合同于 \(I\)。合同关系不改变矩阵的正定性。
- 正定矩阵的行列式大于 0。
- 矩阵 \(A\) 为正定矩阵的充要条件是,\(A\) 的每一个顺序主子式 \(A\dbinom{1, 2, \cdots, k}{1, 2, \cdots, k}>0\)。
- 同时可以定义半正定、负定、半负定等概念。
\(\rm VII\) 线性空间、线性映射
这一章的内容很早之前就通过几何直觉理解过了,只用记一些概念和定义。
【线性空间的定义】
- 我们需要一个抽象集合 \(V\) 与一个数域 \(K\),在 \(V\) 中定义加法运算:\(\gamma = \alpha + \beta,\forall \alpha, \beta\in V\) 和数乘运算 \(\gamma = k\alpha, \forall \alpha\in V, k\in K\)。
- 需要满足八个定律:加法交换律、加法结合律、加法零元素、加法负元素、乘法一元素、数乘结合律、数字分配率、向量分配率。
- 若 \(V\) 是某个已知的线性空间的子集,那么只需验证对于加法和数乘封闭。
线性代数(B):知识点梳理
针对一些概念性以及结论性的东西,在此进行梳理(应试导向)。
Chapter 4 矩阵
【矩阵乘积的性质】
- 若干秩不等式:
- \(\mathrm{rank}(AB)\le\min\{\mathrm{rank}(A), \mathrm{rank}(B)\}\)。
- \(\mathrm{rank}(AB)\ge\mathrm{rank}(A)+\mathrm{rank}(B)-n\)。
- 若 \(AB=0\),则 \(\mathrm{rank}(A)+\mathrm{rank}(B)\le n\)。
- 矩阵乘积的行列式:\(|AB|=|A||B|\)。
【分块矩阵】
- 分块矩阵的乘法:在 \(C=AB\) 中,\(A\) 在列上的分块情况应当与 \(B\) 在行上的分块情况完全一致,且每块相乘的时候需要保证左右顺序的一致。
- 分块矩阵的初等行变换:在乘法时为左乘。(一行同时左乘一个可逆矩阵 \(P\),行列式乘上 \(\det(P)\))
- 分块矩阵的初等列变换:在乘法时为右乘。
- Sylvester 不等式:\(\mathrm{rank}(AB)\ge\mathrm{rank}(A)+\mathrm{rank}(B)-n\)。
- (\(A:s\times n, B:n\times m\))
- (书上 P139 有幂等矩阵)
- Binet-Cauchy 公式:\(A\) 为 \(s\times n\) 矩阵,\(B\) 为 \(n\times s\) 矩阵(\(s\le n\)),则有 \(\det(AB)=\sum\limits_{1\le v_1<v_2<\cdots<v_s\le n}A\dbinom{1\sim s}{v_1\sim v_s}\cdot B\dbinom{v_1\sim v_s}{1\sim s}\)。若 \(s>n\),则 \(\det(AB)=0\)。(常用的秩不等式总结?这是应试模块)
【正交矩阵】
- 概念:代数上满足 \(A^T=A^{-1}\)。实质为各个行 / 列向量都为单位向量且两两正交。表示的是纯旋转 / 反射的变换。
- Schmidt 正交化:设 \(\alpha_1\sim\alpha_n\) 为待正交化的向量组,则令 \(\beta_k=\alpha_k-\sum\limits_{i=1}^{n-1}\dfrac{\alpha_k\cdot\beta_i}{\beta_i^2}\beta_i\)。然后令 \(\eta_i=\dfrac{\beta_i}{\|\beta_i\|}\) 即得到单位正交的向量组 \(\eta_1\sim\eta_n\)。
Chapter 5 矩阵的相抵与相似
【矩阵的相抵】
- 定义:\(A\) 能经过一系列初等行列变换变成 \(B\),则 \(A\) 与 \(B\) 相抵。
- 实质:两个 \(s\times n\) 矩阵相抵的充要条件是他们的秩相等。(初等行变换可以理解为左乘初等矩阵,初等列变换可以理解为右乘初等矩阵,任意的满秩方阵都可以分解为初等矩阵的乘积)
- 相抵标准型:\(A=\begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}_{s\times n}, r=\mathrm{rank}(A)\)。存在可逆矩阵 \(P_{s\times s}, Q_{n\times n}\) 使得 \(A=P\begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}Q\)。
【矩阵的相似】
- 定义:存在可逆矩阵 \(P\) 使得 \(P^{-1}AP=B\),则 \(A\sim B\)。
- 实质:相似描述的是同一个线性变换在不同基下的呈现形式。(但过渡矩阵那一块我有点不扎实)
- \(A\sim B\),则 \(\mathrm{rank}(A)=\mathrm{rank}(B), \mathrm{tr}(A)=\mathrm{tr}(B), \det(A)=\det(B)\)。拥有相同的特征多项式。
- (这里貌似出现了是幂等矩阵、对合矩阵之类的了,是应试模块)
【特征值、特征向量】
- 定义:存在值 \(\lambda\) 与向量 \(\mathbf v\) 满足 \(A\mathbf v=\lambda\mathbf v\),则称 \(\lambda\) 为方阵 \(A\) 的一个特征值,\(\mathbf v\) 为特征值 \(\lambda\) 对应的一个特征向量。
- 求特征值:特征多项式 \(\det(\lambda I-A)\)。其在 \(\mathbb C\) 上一定有 \(n\) 个根。\(\lambda_0\) 为 \(A\) 的一个特征值当且仅当 \(\det(\lambda_0I-A)=0\)。一个特征值 \(\lambda\) 可能对应多个特征向量 \(\mathbf v_1, \mathbf v_2, \cdots, \mathbf v_s\),这些特征向量线性无关,其直和构成有关特征值 \(\lambda\) 的特征子空间。不同特征子空间直和。
【矩阵的对角化】
- 若矩阵 \(A\) 相似于对角矩阵 \(\Lambda\),则称 \(A\) 可对角化。
- 数域上 \(K\) 的矩阵 \(A\) 可对角化,充要条件是 \(A\) 的特征多项式的每一个根都属于 \(K\),且每个特征值的代数重数等于几何重数。换句话说,所有特征子空间的直和为 \(K^n\)。
- 有关代数重数与几何重数的具体关系,是 Jordan 块与 Jordan 标准型讨论的内容,这里不深究。
- 求法:求所有特征值 \(\lambda_1, \lambda_2, \cdots, \lambda_m\),对每个特征值 \(\lambda_i\) 都求出对应的特征向量 \(\mathbf v_{i, 1}, \mathbf v_{i, 2}, \cdots, \mathbf v_{i, m_i}\)。令 \(P=\begin{pmatrix} \mathbf v_1 & \mathbf v_2 & \cdots & \mathbf v_n \end{pmatrix}\)(按一定顺序排列),则满足 \(AP=P\Lambda\),此时 \(\Lambda=\mathrm{diag}(\lambda_1, \lambda_2, \cdots, \lambda_n)\),按照特征向量对应特征值的顺序排列。
【实对称矩阵】
- 实对称矩阵一定存在 \(n\) 个实数特征值,一定可对角化。
- 实对称矩阵有关不同特征值的特征向量是正交的。
- 实对称矩阵一定正交相似(正交合同)于对角矩阵。
- 矩阵是实对称矩阵的充要条件是可以正交对角化。
Chapter 6 二次型·矩阵的合同
【二次型与合同标准型】
- 二次型:\(\mathbf x=(x_1, x_2, \cdots, x_n)^T, f(\mathbf x)=\mathbf x^TA\mathbf x\),其中 \(A\) 为对应的对称矩阵。
- 对二次型做非退化线性变换 \(\mathbf x=C\mathbf y\)(其中 \(C\) 可逆),得到 \(\mathbf x^TA\mathbf x=\mathbf y^T(C^TAC)\mathbf y\)。记作 \(B=C^TAC\),即 \(B\cong A\) 或 \(\mathbf x^TA\mathbf x=\mathbf y^TB\mathbf y\)。
- 合同标准型:\(A\cong\Lambda=\mathrm{diag}(\lambda_1, \lambda_2, \cdots, \lambda_n)\)。(注意合同标准型只要求是对角矩阵即可)
- 正交合同:也就是正交相似。需要求正交矩阵 \(Q\) 满足 \(Q^TAQ=\Lambda\)。(求法很重要)
- 求法:求所有特征值以及所有对应的特征向量。进行 Schmidt 正交化(只需同一个特征值内部正交化)。然后按照列向量排列为 \(Q\)。此时 \(\mathbf x=Q\mathbf y\) 即为正交替换。
- 配方法,直接做题训练。
- 任意的实对称矩阵都合同于对角矩阵。任意一个二次型都合同于一个只含平方项的二次型。
【实二次型的规范型】
- 对于实二次型(实对称矩阵),合同的本质在于(充要条件)拥有相同的惯性指数 \(p, q\)。这里 \(\mathrm{rank}(A)=r=p+q\)。默认 \(p\) 表示正惯性指数。几何上理解就是圆锥曲线有多少个方向是椭圆的、双曲的、柱面的。
- 规范型唯一:\(p\) 个 \(1\),\(q\) 个 \(-1\),剩下为 \(0\) 的对角矩阵。
【正定】
- 定义:\(\forall\mathbf x\in\mathbb R^n\),有 \(\mathbf x^TA\mathbf x>0\),则称 \(A\) 正定。类似有半正定、负定、半负定。
- 正定的充要条件是 \(p=n\),此时 \(A\cong I\),存在可逆矩阵使得 \(A=C^TC\)。
- 实对称矩阵正定的充要条件是每一个顺序主子式大于 \(0\)。
Chapter 7 线性空间
【线性空间】
- 八条定律(需要 \(F, V\)):加法交换律、加法结合律、存在零元素、存在负元素;\(1x=x\),\((kl)x=k(lx)\),\((k+l)x=kx+lx\),\(k(x+y)=kx+ky\)。
- 证明一个 \(F, V\) 是线性空间,其中 \(V\) 是某个已知线性空间的子集,则只需验证两条:\(x, y\in V\) 则 \(x+y\in V\);\(x\in V\) 则 \(kx\in V\)。(是这样吗?)
- 过渡矩阵(不扎实):定义为 \(\begin{pmatrix} \beta_1 & \beta_2 & \cdots & \beta_n\end{pmatrix}=\begin{pmatrix} \alpha_1 & \alpha_2 & \cdots & \alpha_n \end{pmatrix}A\)。称 \(A\) 是基 \(\alpha\) 到基 \(\beta\) 的过渡矩阵。
- \(A\) 的第 \(j\) 列为 \(\beta_j\) 在原基 \(\alpha_1\sim\alpha_n\) 的坐标。
【子空间的交与直和】
- (各种维数公式都来了)
- 验证直和:\(V_1\cap V_2=\{0\}\),\(V_1\cup V_2=W\)。
- (有关这一块的计算?)
【线性空间的同构】
- 设在 \(V\) 与 \(V'\) 中存在映射 \(\sigma\) 使得两者中的元素存在一个一一对应的关系 \(\sigma(x)=x'\),则 \(V\cong V'\)。充要条件是 \(\dim V=\dim V'\)。
Chapter 8 线性映射
【线性映射】
- 像、原像:
- \(\ker\mathscr A:\mathrm{Nul}(A)\);
- \(\mathrm{Im}\mathscr A:\mathrm{Col}(A)\)。
- 线性映射:\(\mathscr A:V\to V'\),满足 \(\mathscr A(x+y)=\mathscr A(x)+\mathscr A(y)\) 且 \(\mathscr A(kx)=k\mathscr A(x)\)。称 \(\mathscr A:V\to V\) 的线性映射为线性变换。
- 零变换:\(\mathscr 0(x)=0\);恒等变换:\(\mathscr I(x)=x\)。
- \(\mathrm{Hom}(V, V')\) 代表 \(V\to V'\) 的所有线性映射的集合,其本身也是一个线性空间。
【线性变换的矩阵表示】
- 也就是:\(\begin{pmatrix} \mathscr A(x_1) & \mathscr A(x_2) & \cdots & \mathscr A(x_n) \end{pmatrix}=\begin{pmatrix} x_1 & x_2 & \cdots & x_n \end{pmatrix}A\)。称 \(A\) 为线性变换 \(\mathscr A\) 在基 \(x_1\sim x_n\) 下的矩阵。
- 意思是,假设一个向量 \(\alpha\) 在基 \(x_1\sim x_n\) 的坐标为 \(\mathbf a=(a_1, a_2, \cdots, a_n)\),则 \(\mathscr A(\alpha)\) 在同一个基下的坐标为 \(A\mathbf a\)。
- \(\mathrm{Hom}(V, V')\cong \mathbf M_{\dim V\times \dim V'}(K)\)。
- 同一个线性变换 \(\mathscr A\) 在基 \(\alpha_1\sim\alpha_n\) 的矩阵为 \(A\),在基 \(\beta_1\sim\beta_n\) 的矩阵为 \(B\),从 \(\alpha_i\) 到 \(\beta_i\) 的过渡矩阵为 \(S\),则有:\(B=S^{-1}AS\)。这是相似的本质。(但是我还没有搞清楚过渡矩阵具体的方向)。
- 换言之,同一个向量 \(p\) 在基 \(\alpha\) 下的坐标为 \(\mathbf a\),在基 \(\beta\) 下的坐标为 \(\mathbf b\),那么这个关系是反过来的:\(\mathbf a=S\mathbf b\)。
- 对线性变换 \(\mathscr A\) 定义的特征值、特征向量、标准型。
【补充:线性变换的特征值与特征向量】
- 转为取一个基下的矩阵。
线性代数(B):计算题整理
I 矩阵求逆
- 目标:给定矩阵 \(A\),求 \(A^{-1}\)。
- 求法:
- 伴随矩阵法:求伴随矩阵 \(A^*\),为每一个地方的代数余子式拼起来转置的结果。然后利用 \(A^*=|A|A^{-1}\) 得到。
- 行变换法:构造矩阵 \(\begin{pmatrix} A & I_n \end{pmatrix}\),对左侧的 \(A\) 进行初等行变换(交换两行、某行乘以非零常数、 某行乘以常数加到另一行),对右侧进行相同的操作,直到左侧为 \(I\),此时矩阵形如 \(\begin{pmatrix} I_n & A^{-1} \end{pmatrix}\)。
II 矩阵正交对角化
- 目标:求正交矩阵 \(Q\) 使得 \(Q^TAQ=\Lambda\),其中 \(\Lambda\) 为对角矩阵。
- 求法:
- 首先求 \(|\lambda I-A|=0\) 解出 \(n\) 个特征值。
- 对于每个特征值 \(\lambda_i\),解出 \((\lambda_iI-A)\mathbf x=0\) 的一组基,作为特征向量。
- 不同特征值之间的特征向量自动正交,同一特征值的向量需要正交化处理(Schmidt)。
- 单位化:所有向量除以自己的模长。
- 按照顺序排列:\(Q=\begin{pmatrix} \mathbf v_1 & \mathbf v_2 & \cdots & \mathbf v_n \end{pmatrix}\),特征向量的顺序与特征值的顺序对应。
- 检查方法:
- 验证 \(Q^TQ=I\)。
- 验证 \(AQ=Q\Lambda\)。
III 二次型的标准化
- 目标:给定一个二次型 \(\mathbf x^TA\mathbf x\) 或者直接给出矩阵 \(A\),要求求可逆变换 \(\mathbf x=C\mathbf y\) 使得变为只含平方项的二次型。
- 求法:
- 配方法(优先):直接针对表达式进行换元操作,需要一定注意力。(尤其适合不用写出变换矩阵 \(C\) 的时候,当然要求写出也没问题)
- 正交替换法:就是 II 中的内容。
- 具体而言,求出 \(\mathbf x=C\mathbf y\) 之后,矩阵 \(C^TAC\) 应当为对角矩阵。所以,求出 \(Q^TAQ=\Lambda\) 中的 \(Q\),那么 \(\mathbf x=Q\mathbf y\) 就是所求的变换。
IV 实对称矩阵的正定性判断
与 III 一致。正定还可以通过每个顺序主子式都正来判定。
V 同一线性变换在不同基下的矩阵
- 目标:给定基 \(\alpha\) 与基 \(\beta\),某一线性变换 \(\mathscr A\) 在基 \(\alpha\) 下的矩阵为 \(A\),求其在基 \(\beta\) 下的矩阵 \(B\)。
- 求法:求 \(\alpha\) 到 \(\beta\) 的过度矩阵 \(S\)。核心要点是:\(S\) 的第 \(j\) 列为 \(\beta_j\) 在基 \(\alpha\) 下的坐标。则 \(B=S^{-1}AS\)。
- 同一个向量在 \(\beta\)(新基)下的坐标为 \(\mathbf x_\beta\),在 \(\alpha\)(旧基)下的坐标为 \(\mathbf x_\alpha\),则有 \(\mathbf x_\alpha=S\mathbf x_\beta\)。
VI 子空间的交与和的基和维数
- 目标:给出子空间 \(V_1\) 和 \(V_2\) 的各一组基 \(\alpha_1\sim\alpha_n\) 与 \(\beta_1\sim\beta_m\),求 \(V_1\cap V_2\) 与 \(V_1\cup V_2\) 的基。
- 求法:
- 并集:将 \(\alpha\) 与 \(\beta\) 按照列向量的方式排布为矩阵 \(A, B\)。则求并集的方式就是构造分块矩阵 \(M=\begin{pmatrix} A & B \end{pmatrix}\) 并对 \(M\) 进行初等列变换。最后就能得到 \(V_1\cup V_2\) 的一组基。
- 交集:设 \(V_1\cap V_2\) 中的某一向量为 \(\mathbf z\),则存在 \(\mathbf x, \mathbf y\) 使得 \(\mathbf z=A\mathbf x\) 且 \(\mathbf z=B\mathbf y\)。也就是要解方程 \(A\mathbf x=B\mathbf y\)。构造分块矩阵方程 \(\begin{pmatrix} A & -B \end{pmatrix}\begin{pmatrix} \mathbf x \\ \mathbf y \end{pmatrix}=0\),解方程得到 \(\begin{pmatrix} \mathbf x \\ \mathbf y \end{pmatrix}\) 的解,进而写出 \(\mathbf z=B\mathbf y\) 或者 \(\mathbf z=A\mathbf x\) 有多少个。
VII 矩阵的幂
- 目标:给定矩阵 \(A\),求 \(A^m\) 的通式。
- 求法:对 \(A\) 进行对角化(课程范围内暂时不考虑不可对角化的情况),求出 \(A=P\Lambda P^{-1}\),其中 \(\Lambda=\mathrm{diag}(\lambda_1, \lambda_2, \cdots, \lambda_n)\)。则 \(A^m=P\Lambda^mP^{-1}=P\mathrm{diag}(\lambda_1^m, \lambda_2^m, \cdots, \lambda_n^m)P^{-1}\)。
\begin{vmatrix} \lambda I_n & B \ 0 & I_s-\dfrac{AB}{\lambda} \end{vmatrix}=\begin{vmatrix} \lambda I_n & B \ A & I_s \end{vmatrix}=\begin{vmatrix} \lambda I_n-BA & 0 \ A & I_s \end{vmatrix}
\begin{vmatrix} A & -B \ B & A \end{vmatrix}=\begin{vmatrix} A & -B \ B+{\text i}A & A-{\text i}B \end{vmatrix}=\begin{vmatrix} A+{\text i}B & -B \ 0 & A-{\text i}B \end{vmatrix}=|A+{\text i}B||A-{\text i}B|.
