很多人第一次学线性代数,看到的是一大堆东西:
向量。
矩阵。
行列式。
线性方程组。
特征值。
基。
维数。
于是很容易产生一个疑问:
这些东西为什么会被放在同一门数学里?
如果只用一句话解释:
线性代数研究的是:当对象可以用“加法和数乘”组合起来时,怎样理解这些组合,以及保持这种组合方式的变换。
真正站在舞台中央的,不是矩阵。
而是线性结构。
先从“可以组合”开始
想象平面上的两个箭头。
一个箭头向右。
另一个箭头向上。
我们可以把它们相加,得到一个新的箭头。
也可以把其中一个箭头放大两倍,或者反向。
这就是向量空间最基本的两种操作:
向量可以相加。
向量可以乘一个标量。
于是,一个复杂向量就可以由一些简单向量组合出来。
例如:
先沿第一个方向走两份,再沿第二个方向走三份。
这就是一个线性组合。
线性代数真正关心的第一件事,就是:
哪些对象可以这样组合?这些组合之间有什么结构?
向量不一定是“箭头”
这里有一个非常重要的地方。
向量只是平面箭头吗?
不是。
箭头只是最容易画出来的例子。
一列数字可以组成向量。
多项式也可以组成向量空间。
矩阵本身也可以组成向量空间。
某些函数集合也可以组成向量空间。
为什么这些看起来完全不同的对象都能叫“向量”?
因为在线性代数里,我们并不要求向量长得像箭头。
真正要求的是:
这些对象能够相加,也能够乘标量,而且这些运算满足向量空间的规则。
所以线性代数进行了一次非常重要的抽象:
把“箭头长什么样”放到一边,只保留加法和缩放的结构。
这一步让同一套方法可以同时处理几何、方程、函数和矩阵。
为什么“基”这么重要?
如果一个向量空间里的所有向量,都可以由少数几个基本向量组合出来,那么我们就不必逐个研究所有向量。
只需要找到一组基。
可以把基理解成:
一套足够表达整个空间,而且彼此没有多余重复的基本方向。
例如普通平面需要两个彼此独立的基本方向。
三维空间需要三个。
一旦选定一组基,每个向量就可以通过一组坐标来描述。
所以坐标不是向量本身。
坐标取决于我们选择了哪一组基。
换一组基,同一个向量的坐标通常会改变。
但向量本身并没有变。
这是理解矩阵之前非常重要的一步。
矩阵其实是线性映射的“坐标记录”
现在考虑一个变换。
它把一个向量送到另一个向量。
如果这个变换保持线性组合,也就是说:
怎么组合输入,就可以用同样的系数组合输出,
那么它就是线性映射。
例如把平面上的所有向量都拉长两倍。
这是线性映射。
绕原点旋转固定角度,也是线性映射。
把三维向量投影到一个平面,在适当语境下也是线性映射。
那么矩阵从哪里来?
当我们给输入空间和输出空间选定基以后,一个线性映射就可以用一张数字表记录。
这张数字表就是矩阵。
所以:
矩阵不是线性代数的全部。矩阵是在选定基以后,对线性映射的一种表示。
换一组基,矩阵可能改变。
但线性映射本身没有因此变成另一个映射。
为什么线性方程组也属于这里?
再看一个熟悉的问题:
一组未知数,同时满足若干个一次方程。
把它们整理以后,经常可以写成:
矩阵乘未知向量,等于给定向量。
也就是常见的“Ax 等于 b”。
这句话的真正意思是:
我们正在寻找一个输入向量,使某个线性映射把它送到指定的输出。
这样一来,解线性方程组就不再只是消元计算。
它变成了一个结构问题:
目标向量是否落在这个线性映射能够到达的范围里?
如果能到达,有多少个输入会被送到那里?
这就自然引出了像“核”和“像”这样的概念。
核记录哪些输入会被送到零。
像记录哪些输出真正能够被得到。
维数为什么会出现?
如果一组基有三个向量,我们说这个空间是三维的。
如果需要五个基向量,就是五维。
一个关键事实是:
对于有限维向量空间,任意两组基都拥有相同数量的向量。
因此“维数”不是选基造成的偶然结果。
它是空间本身的结构特征。
现在再看一个有限维线性映射。
有些输入方向可能被压到零。
这些方向形成核。
还有一些信息真正传到了输出空间。
它们构成像。
在线性代数里,这两部分之间有一个非常漂亮的关系:
输入空间的维数,等于核的维数,加上映射像的维数。
这就是秩与零化度关系的核心内容。
它告诉我们:
一个线性映射把多少方向“消掉了”,又保留下多少独立方向,两者正好分配了输入空间的维数。
可逆到底意味着什么?
再看一个方阵。
如果它对应的线性映射能够一一对应地把空间变到自身,并且可以完整地倒回来,我们称它可逆。
在有限维情况下,对于一个方阵,有很多看起来不同的判断最终是等价的。
比如:
对应的线性映射可逆。
方阵存在逆矩阵。
它的行列式不等于零。
对应的齐次方程只有零解。
这些结论之所以会连在一起,是因为它们其实都在描述同一件事:
这个线性变换有没有丢失信息。
如果没有把任何非零方向压成零,就可能完整恢复输入。
如果某个方向被压没了,就不可能再唯一找回来。
为什么特征向量会重要?
有些线性变换会改变大多数向量的方向。
但可能存在一些特殊方向。
沿着这些方向的向量经过变换以后,只被放大、缩小或者反向,却不离开原来的直线方向。
这样的向量就是特征向量。
对应的缩放倍数叫特征值。
这也是线性代数特别有力量的地方:
一个看起来复杂的变换,如果能找到合适的特殊方向,有时就能被拆成非常简单的缩放行为。
对角化就是这种思想的重要表现。
但核心仍然没有变。
我们一直在问:
一个保持线性组合的变换,内部究竟怎样作用于空间?
现在回到最开始的问题
为什么向量、矩阵、方程组、基、维数、特征值会被放进同一门数学里?
因为它们并不是一堆偶然拼在一起的技巧。
它们都围绕同一个问题:
怎样描述线性组合,以及怎样理解保持线性组合的变换。
向量空间告诉我们什么东西能够被线性组合。
基告诉我们如何用最少的基本方向描述整个空间。
矩阵把线性映射写成可以计算的数据。
线性方程组是在寻找线性映射的原像。
核和像描述信息丢失与到达的范围。
维数记录独立方向的数量。
特征值和特征向量则帮助我们寻找变换最自然的方向。
所以,线性代数最值得记住的,不是某一个行列式公式,也不是某一种矩阵消元技巧。
而是:
线性代数把复杂对象拆成基本方向,再研究这些方向怎样组合、怎样变换。
一旦一个问题拥有线性结构,我们就有机会把它拆开、计算,再重新组合。
这才是线性代数真正统一的力量。
作者:结构化AI创作笔记
欢迎合规转载,请保留作者署名及完整版权信息。
热门跟贴