很多人第一次学线性代数,看到的是一大堆东西:

向量。

矩阵。

行列式。

线性方程组。

特征值。

基。

维数。

于是很容易产生一个疑问:

这些东西为什么会被放在同一门数学里?

如果只用一句话解释:

线性代数研究的是:当对象可以用“加法和数乘”组合起来时,怎样理解这些组合,以及保持这种组合方式的变换。

真正站在舞台中央的,不是矩阵。

而是线性结构

先从“可以组合”开始

想象平面上的两个箭头。

一个箭头向右。

另一个箭头向上。

我们可以把它们相加,得到一个新的箭头。

也可以把其中一个箭头放大两倍,或者反向。

这就是向量空间最基本的两种操作:

向量可以相加。

向量可以乘一个标量。

于是,一个复杂向量就可以由一些简单向量组合出来。

例如:

先沿第一个方向走两份,再沿第二个方向走三份。

这就是一个线性组合。

线性代数真正关心的第一件事,就是:

哪些对象可以这样组合?这些组合之间有什么结构?

向量不一定是“箭头”

这里有一个非常重要的地方。

向量只是平面箭头吗?

不是。

箭头只是最容易画出来的例子。

一列数字可以组成向量。

多项式也可以组成向量空间。

矩阵本身也可以组成向量空间。

某些函数集合也可以组成向量空间。

为什么这些看起来完全不同的对象都能叫“向量”?

因为在线性代数里,我们并不要求向量长得像箭头。

真正要求的是:

这些对象能够相加,也能够乘标量,而且这些运算满足向量空间的规则。

所以线性代数进行了一次非常重要的抽象:

把“箭头长什么样”放到一边,只保留加法和缩放的结构。

这一步让同一套方法可以同时处理几何、方程、函数和矩阵。

为什么“基”这么重要?

如果一个向量空间里的所有向量,都可以由少数几个基本向量组合出来,那么我们就不必逐个研究所有向量。

只需要找到一组基。

可以把基理解成:

一套足够表达整个空间,而且彼此没有多余重复的基本方向。

例如普通平面需要两个彼此独立的基本方向。

三维空间需要三个。

一旦选定一组基,每个向量就可以通过一组坐标来描述。

所以坐标不是向量本身。

坐标取决于我们选择了哪一组基。

换一组基,同一个向量的坐标通常会改变。

但向量本身并没有变。

这是理解矩阵之前非常重要的一步。

矩阵其实是线性映射的“坐标记录”

现在考虑一个变换。

它把一个向量送到另一个向量。

如果这个变换保持线性组合,也就是说:

怎么组合输入,就可以用同样的系数组合输出,

那么它就是线性映射。

例如把平面上的所有向量都拉长两倍。

这是线性映射。

绕原点旋转固定角度,也是线性映射。

把三维向量投影到一个平面,在适当语境下也是线性映射。

那么矩阵从哪里来?

当我们给输入空间和输出空间选定基以后,一个线性映射就可以用一张数字表记录。

这张数字表就是矩阵。

所以:

矩阵不是线性代数的全部。矩阵是在选定基以后,对线性映射的一种表示。

换一组基,矩阵可能改变。

但线性映射本身没有因此变成另一个映射。

为什么线性方程组也属于这里?

再看一个熟悉的问题:

一组未知数,同时满足若干个一次方程。

把它们整理以后,经常可以写成:

矩阵乘未知向量,等于给定向量。

也就是常见的“Ax 等于 b”。

这句话的真正意思是:

我们正在寻找一个输入向量,使某个线性映射把它送到指定的输出。

这样一来,解线性方程组就不再只是消元计算。

它变成了一个结构问题:

目标向量是否落在这个线性映射能够到达的范围里?

如果能到达,有多少个输入会被送到那里?

这就自然引出了像“核”和“像”这样的概念。

核记录哪些输入会被送到零。

像记录哪些输出真正能够被得到。

维数为什么会出现?

如果一组基有三个向量,我们说这个空间是三维的。

如果需要五个基向量,就是五维。

一个关键事实是:

对于有限维向量空间,任意两组基都拥有相同数量的向量。

因此“维数”不是选基造成的偶然结果。

它是空间本身的结构特征。

现在再看一个有限维线性映射。

有些输入方向可能被压到零。

这些方向形成核。

还有一些信息真正传到了输出空间。

它们构成像。

在线性代数里,这两部分之间有一个非常漂亮的关系:

输入空间的维数,等于核的维数,加上映射像的维数。

这就是秩与零化度关系的核心内容。

它告诉我们:

一个线性映射把多少方向“消掉了”,又保留下多少独立方向,两者正好分配了输入空间的维数。

可逆到底意味着什么?

再看一个方阵。

如果它对应的线性映射能够一一对应地把空间变到自身,并且可以完整地倒回来,我们称它可逆。

在有限维情况下,对于一个方阵,有很多看起来不同的判断最终是等价的。

比如:

对应的线性映射可逆。

方阵存在逆矩阵。

它的行列式不等于零。

对应的齐次方程只有零解。

这些结论之所以会连在一起,是因为它们其实都在描述同一件事:

这个线性变换有没有丢失信息。

如果没有把任何非零方向压成零,就可能完整恢复输入。

如果某个方向被压没了,就不可能再唯一找回来。

为什么特征向量会重要?

有些线性变换会改变大多数向量的方向。

但可能存在一些特殊方向。

沿着这些方向的向量经过变换以后,只被放大、缩小或者反向,却不离开原来的直线方向。

这样的向量就是特征向量。

对应的缩放倍数叫特征值

这也是线性代数特别有力量的地方:

一个看起来复杂的变换,如果能找到合适的特殊方向,有时就能被拆成非常简单的缩放行为。

对角化就是这种思想的重要表现。

但核心仍然没有变。

我们一直在问:

一个保持线性组合的变换,内部究竟怎样作用于空间?

现在回到最开始的问题

为什么向量、矩阵、方程组、基、维数、特征值会被放进同一门数学里?

因为它们并不是一堆偶然拼在一起的技巧。

它们都围绕同一个问题:

怎样描述线性组合,以及怎样理解保持线性组合的变换。

向量空间告诉我们什么东西能够被线性组合。

基告诉我们如何用最少的基本方向描述整个空间。

矩阵把线性映射写成可以计算的数据。

线性方程组是在寻找线性映射的原像。

核和像描述信息丢失与到达的范围。

维数记录独立方向的数量。

特征值和特征向量则帮助我们寻找变换最自然的方向。

所以,线性代数最值得记住的,不是某一个行列式公式,也不是某一种矩阵消元技巧。

而是:

线性代数把复杂对象拆成基本方向,再研究这些方向怎样组合、怎样变换。

一旦一个问题拥有线性结构,我们就有机会把它拆开、计算,再重新组合。

这才是线性代数真正统一的力量。

作者:结构化AI创作笔记

欢迎合规转载,请保留作者署名及完整版权信息。

打开网易新闻 查看精彩图片