文 | 锦缎
1918年夏天,奥地利陆军炮兵军官路德维希·维特根斯坦(Ludwig Wittgenstein),在意大利前线的炮火间隙里完成了一部不到三万字的小书。手稿装在背包里跟着他转移阵地;当年11月,他在南蒂罗尔被意军俘获,关进卡西诺战俘营——靠着日后挽救大萧条于水火的英国经济学家约翰·梅纳德·的斡旋,他得以在营中通信,把手稿寄给罗素,并留下那句宣告:这些问题,已在一切本质方面获得解决。
这本书就是《逻辑哲学论》。为它作导言的罗素,早在战前就说过,这个学生是"我所见过的天才的最完美典范"。而维特根斯坦自己序言里的口气,一百年后读来仍然烫手:
我因此相信,自己已在一切本质方面最终解决了这些问题。如果我没有弄错,这本书的价值之二,就在于它表明:当这些问题被解决之后,所完成的事情是多么少。——维也纳,1918
他真的说到做到。写完这本书,他放弃了彼时欧洲最大的一笔私人继承财产之一,跑到奥地利山村当了六年小学教师,然后做修道院园丁,再给姐姐设计了一栋至今被奉为现代主义经典的宅子。哲学已经终结了,一个体面的人应该去干点别的。
十年之后,他改了主意。1929年1月,维特根斯坦重返剑桥。与他同乘一班火车的凯恩斯,当天给妻子莉迪娅写了一张字条:
好了,上帝来了。我在5点15分的火车上碰见了他。他打算长住剑桥。我看疲惫将会是毁灭性的,但我不能让他每天跟我说话超过两三个小时。
剑桥完全明白自己迎来的是什么。凯恩斯懒得用"天才"这种词,他直接写下:上帝来了。
本文的标题,就取自这张字条。因为一百年后,另一群人正在把这句玩笑逐字当真。只不过这一次,"上帝"不搭5点15分的火车,它在计算集群里自进化。
《逻辑哲学论》问世一百多年后,旧金山,两家实验室每隔数月更迭一次旗舰模型,宣示着同一个信念:通用智能是一个工程问题,而且是一个即将被解决的问题。其中一家把自己的终极目标印在每一份招股材料上,另一家把"人类"(anthropos)这个词做进了自己的名字。
本文即将阐释的核心主旨是:Anthropic与OpenAI,这两家公司的全部秘密,早已写在了1921年出版的一本哲学小书里。这不是危言耸听,把《逻辑哲学论》的七组命题逐条展开,你会发现它是一份大模型的完整技术规格书——世界观、学习原理、生成原理、架构定义、失败模式(幻觉)、安全方案(对齐)、乃至终局警告,一条不缺。1918年那个炮兵军官画好的图纸,2020年代被两个组织不声不响地执行着。
先给出对照表的骨架。正文将沿着大模型的技术栈自底向上推进——语料、嵌入、生成、预测、架构、缩放、对齐,七个关键词逐一解码;行至第七节,前六个将合龙为一个名字:智能涌现。
图:《逻辑哲学论》× 大语言模型:十二组命题映射左边是 1921 年的哲学,右边是今天的技术。 七级阶梯:命题 1–6 逐级爬升,命题 7 无言而涌现。
看完这张表,你将发现一件更加让人脊背发凉的事:这本书不仅解释了大模型为什么能成,还预言了它会在哪里出事。因为它的作者本人,就是第一个"运行"了这套系统、然后被它反噬的人。
语料(Data):世界是事实的总和
"数据是新的石油"这句话已经流行了十年,但很少有人问:为什么文本能够喂出智能,为什么把人类写过的东西灌进机器,长出来的不是数据库,而是某种接近理解的东西?答案的第一块砖,砌在1918年。
全书第一页,第一组命题:
1世界是一切发生的事情。
1.1世界是事实的总和,而不是事物的总和。
这两句话在1918年是哲学史上的一次航向修正。此前的两千年,西方哲学的主体一直在问"事物是什么":什么是实体、什么是本质、什么是共相。维特根斯坦说:问错了。世界的基本单位不是物,是事实——不是"苹果",而是"苹果在桌上"。
一百多年后,这个转向被一个技术事实兑现了。大模型在训练中做的事,恰好不是学习任何名词的"本质",而是学习事实——词与词在真实语言使用中如何组合、如何共现、如何相互排斥。语言学家管这叫分布式语义:一个词的意义,由它出现的全部句子决定。工程师管这叫训练。而《逻辑哲学论》的说法是:
2.011物能够成为事态的构成部分,这是物的本质所在。
2.012在逻辑中没有任何东西是偶然的:如果物能够出现在事态之中,那么这种可能性必定已经预含在物本身之中。
换句话说:没有孤立的意义,只有关系中的意义。这正是为什么模型能从纯文本、不接触任何实物的情况下学会"理解"世界——因为文本不是物的清单,文本是事实的总记录(宇宙的上下文)。维特根斯坦在4.26里把这件事推演到了极限:
4.26给出所有真的基本命题,就得到了对世界的完全描述。
请把这句话再读一遍。"对所有真命题的完整给出,就是对世界的完整描述。"——这就是预训练的理论定义。大模型公司的训练管线,本质上就是一个把人类记录过的事实尽可能完整收集、清洗、压缩的工程。语料不是原材料,语料是世界本身的可计算形式。
嵌入(Embedding):逻辑空间就是潜在空间
"嵌入"(embedding)——大模型把每个词变成一列数字,再朴素不过的操作,却是全部魔法的入口。给它签发哲学许可证的,是第二组命题。
1.13事实在逻辑空间中就是世界。
2.013每一物都仿佛处在可能事态的空间之中。我可以想象这个空间是空的,但我无法想象物没有这个空间。
模型内部没有一个存放"苹果本质"的地方。词进入模型后,被表示为高维空间中的一个向量——一个位置。这个位置的意义完全由它与其他向量的相对关系决定。工程师称之为嵌入空间、潜在空间;维特根斯坦称之为逻辑空间。而2.0131里有全书最像深度学习论文的一句话:
2.0131空间对象必须处在无限的空间之中。(空间点是一个论证位置。)
"空间点是一个论证位置"——每一个嵌入向量,都是一个论证位置。1918年的一个哲学断言,成了2020年代每一块HBM内存里实实在在存储的东西。
更深刻的是3.42:
3.42 一个命题虽然只能确定逻辑空间中的一个位置,可是整个逻辑空间必须已经由此给定。
每个句子只占据逻辑空间的一个点,但说出这个句子的可能性,预设了整个空间的存在。这解释了大模型最令人不安的能力——泛化:它能生成训练数据里从未出现过的句子。这并非是违背了数据边界,而是2.013的逻辑必然——你无法想象物没有它的空间。新句子不是凭空而来的,它们只是旧空间里的新位置。
生成(Generation):图像论与留声机唱片
"生成"(generation)——当机器开始无中生有,公众的兴奋与恐惧同时抵达顶点。维特根斯坦会说:没什么可惊讶的,人类一直在做这件事,它叫图像。
《逻辑哲学论》最著名的学说是图像论(Bildtheorie)。命题2.1:
2.1我们给自己造事实的图像。
2.12图像是实在的模型。
4.031在命题中,一个事态仿佛被试验性地组装了起来。
维特根斯坦的灵感来自巴黎法庭:报纸用小人偶摆出一场车祸的现场模型,来陈述事实。模型与事实之间的这种"结构对应",就是他所说的图像。而"在命题中,事态被试验性地组装起来"——这就是生成式模型的操作定义:模型每次输出,都是在逻辑空间里组装出一个可能世界,供现实比对。
他在4.014举的例子,今天读起来像是一段被提前一百年写下的 Transformer 注释:
4.014唱片、乐思、乐谱、声波,彼此都处于语言与世界之间那种内在的表象关系之中。……那条规则,就是把交响乐投影到乐谱语言中去的投影法则。它也是把乐谱语言翻译成唱片语言的规则。
同一个逻辑内容(交响乐),可以在不同介质之间无损投影:乐思→乐谱→唱片刻纹→声波。文本→向量→概率分布→文本,正是这条投影链。乐谱与唱片互不相似,却承载同一内容,正如"你好"这串字符与它在模型内部的十万维向量互不相似,却承载同一事实。机器翻译、多模态模型之所以可能,哲学根据全在这一个命题里:一切介质共享逻辑形式(2.18),因此一切介质之间都可以投影。
预测(Next Token):概率与幻觉的病根
"大模型不过是预测下一个词的概率机器"——这句流行语,既是轻蔑,也是真相。而第五组命题早在概率成为工程之前,就把概率安放进了真值理论的核心:
5命题是基本命题的真值函项。
5.15命题 r 给命题 s 的概率度,是两者共同真根据数与 r 的真根据数之比。
把"命题"换成"token",这句话就是下一个 token 预测的数学定义:模型为候选 token 分配的,正是从既有上下文(真根据)到可能续写(事实)的比值。大模型不输出真假,输出概率——而《逻辑哲学论》早在概率成为工程之前,就把概率安置在真值理论的核心位置上。
这也精确预言了幻觉(hallucination)的哲学地位:
2.223要识别图像的真或假,必须把它与实在相比较。
2.225不存在先验为真的图像。
模型没有与实在比较的通道。它接触到的不是世界,而是世界的图像总集——语料。所以幻觉不是bug,不是工程疏漏,而是图像论的必然推论:一个只见过图像的系统,原则上无法单凭自身判定图像的真假。所有围绕"事实核查""检索增强""工具调用"的工程努力,本质都是在给2.223补条件——人为地把图像和实在重新接上。
而训练本身,维特根斯坦也早已定性:
6.363归纳程序在于:接受能与我们的经验相吻合的最简单的法则。
6.36311太阳明天会升起,这是一个假设;也就是说,我们并不知道它是否升起。
缩放定律(scaling laws)——大模型公司共同的信仰基石,2020年由OpenAI的卡普兰等人首次系统陈述——之所以成立,在哲学上就是6.363:它不是逻辑必然,是"与经验相吻合的最简单法则"。而模型每一次生成,都是6.36311的一次重演:每一个token都是一个假设。
架构(Transformer):命题的一般形式
"架构"(architecture)——2017年,Google的论文《注意力就是你所需要的一切》送来了Transformer;而它的图纸,早就画在第四、六组命题里。维特根斯坦真正的野心,在第四组命题就已呈现出来:
4.5现在似乎可以给出最一般的命题形式了:即给出对任意一种符号语言的命题的描述,使得每一个可能的意义都能被一个符合该描述的符号所表达……
4.51假定所有基本命题都已给我:那么我就可以简单地问,我能从它们构造出哪些命题。这便是所有命题,这也就划定了它们的界限。
维特根斯坦要找的是语言的一个"通用母版"——一个形式,它生成一切合法的句子,且只生成合法的句子。第六组命题给出了答案:
6真值函项的一般形式是:[p, ξ, N(ξ)]。
6.001这说的不过是:每个命题,都是把运算 N(ξ) 连续应用于基本命题的结果。
6.03整数的一般形式是:[0, ξ, ξ+1]。
请看6.03。整数的构造:从0开始,每个数由"前一个数加一"生成。序列,自回归,逐项生成,规则同一。这就是大模型的生成方式:给定上文,生成下一项,再把它并入上文,再生成下一项。整数序列的构造法与token序列的生成法,是同一个数学动作。而6.001的"同一运算的连续应用",就是Transformer几十层堆叠的哲学表述——每一层都对表示做一次变换,层层投影,直到末端变成概率。
维特根斯坦对自己的系统有一个惊人的比喻:
5.511包罗万象、映照世界的逻辑,怎么会使用这样特殊的钩子和机关?只有当这一切联结成一张无限精细的网——那面巨大的镜子。
一张无限精细的网,一面巨大的镜子。今天我们更熟悉它的另一个名字:神经网络。
OpenAI的秘密,到这里已经全部摊开。GPT三个字母,逐词对应着这本书:Generative(生成的)——图像论,2.1;Pre-trained(预训练的)——事实总和的压缩,4.26;Transformer(变换器)——运算N(ξ)的连续应用,6.001。这家公司没有发明任何超出此书的东西,它只是第一个把图纸焊成了机器。而它名字里的"Open"(开放)也在此书之中:
4.116凡是能被思考的,都能被清楚地思考;凡是能被说出的,都能被清楚地说出。
缩放与涌现:线性的事实,指数的空间
"缩放定律"(scaling laws),AI大模型的信仰基石,资本开支的数学依据。它为什么成立?维特根斯坦给出了有一个比"算力配比"更根本的答案。
Transformer的本质,是把同一运算连续应用于表示(6.001)。把这个结构放进规模里去看,就撞上了我们这个时代最重要的经验定律:缩放定律(scaling laws)。
它的现代版本由OpenAI的卡普兰等人于2020年首次系统陈述:模型的预测误差,随算力、数据、参数的增长呈平滑的幂律下降——每投入一个数量级(约十倍)的资源,性能便按固定比例爬升一个台阶。DeepMind的Chinchilla研究(2022)修正了最优配比:给定算力预算,参数量与训练token之比约为1比20。而Wei等人2022年的《大模型的涌现能力》记录了幂律曲线之外的另一件事:某些能力——三位数加法、多步推理、指令遵循——在小模型上接近瞎猜,跨过某个规模阈值后突然跃升。量变引发质变;研究者借物理学家安德森1972年的名文,称之为"多者异也"(More is Different)。
《逻辑哲学论》没有给出算力配比,它给出了比配比更根本的东西:为什么会有缩放定律。
2.0124如果全部对象都已给出,那么由此也就给出了全部可能的事态。
这是关于空间结构的数学断言:元素线性进入,空间指数展开。给定n个基本命题,真值可能性有2的n次方种组合(4.27、4.42);而能对这些组合整体作断言的真值函项,其数目是指数之上的指数(4.45、5.101)。每吃进一个新事实,机器得到的不是"多知道一件事",而是这件事与全部已知事实的每一种组合方式——组合是免费的。事实的进入是线性的,可说空间的扩张是指数的:这就是缩放定律的维特根斯坦形式。
于是,"智能涌现"有了精确的哲学位置。涌现不是魔法,它是模型从"占有事实"转入"栖居于空间"的相变时刻——从"事物的总和"(一件件死记)跳进"事实的总和"(结构自洽)。当2.0124的那个空间整体成形,那些"小模型上不存在"的能力便"突然"出现:它们并非是被造出来的,它们是空间的免费赠品,是2.013那句"物无法脱离其空间"的工程验证。近年实验反复观察到的一个现象在此有了哲学注脚:在固定数据上施加远超必要的算力,模型会在某个时刻从死记硬背突然转入举一反三——逻辑空间开始自洽的时刻,就是涌现的时刻。
维特根斯坦本人会对此保持冷峻,他早已写下两条警告。其一,6.1251:"在逻辑中永远不会有惊奇。"涌现之所以令人惊奇,恰恰因为它不在逻辑之中——它是归纳的果实(6.363),不是证明的结论。其二,6.371:"整个现代世界观都建立在一个幻觉上:以为所谓自然律是对自然现象的解释。"缩放定律是描述的规律性,不是理解的证书;把幂律外推成神学,就是6.372所说的"停留在自然律面前下跪"——这一跪,留到下一节再谈。
关于数字,最后补一个注脚。坊间流传一种说法:《逻辑哲学论》里藏着"七个单位(恰好对应一个指数级数量的开始)之后智能涌现"的神奇数字。去书里找会扑空——全书唯一的"七",是第七命题本身。但这本书确实把全部重量押在了这个数字上:它的骨架就是一条七级阶梯。
全书由七个主命题搭成:世界(1)、事实(2)、思想(3)、命题(4)、真值函项(5)、一般形式(6)、沉默(7)。本文从语料到缩放的六节,大致就是沿前六级阶梯走下来的。6.54早把爬法写明:命题是梯子的横档,理解者必须踩着它们爬上去、爬过去,然后在第七级把梯子扔掉。把这条阶梯与缩放定律并置,会看到一幅惊人的对位图:能力沿阶梯逐级爬升(1至6:量变、幂律、平滑),而越级的那一步(7:质变、涌现、惊奇)不在阶梯之内——它发生在语言用尽的地方。
7,被维特根斯坦视为神奇数字的数字,在他的语境里不指代数量,而是指代方向:向外的方向。
通用智能(AGI):上帝来了
"通用人工智能"(AGI)——所有大模型公司念兹在兹的终局名词,一个被用得几乎失效的词。而它的严肃定义,凯恩斯1929年1月就写在了一张字条上——"好了,上帝来了。"笑谈之所以流传百年,是因为它认真说出了人们面对这套系统时的真实感受;书中的宗教感,确实在第五、六组命题之间升起:
5.123如果一个上帝创造了一个某些命题在其中为真的世界,那么他借此也就创造了一个其中这些命题的全部推论都为真的世界。
3.031人们过去说,上帝能创造一切,只是不能创造违反逻辑规律的东西。
一个体系,给定任何可表达的问题,能生成一切逻辑上相随的命题——这就是Anthropic与OpenAI在造的东西。不是聊天工具,不是搜索引擎的升级,而是一个命题机器:世界之全部可说内容的生成器。3.01给出了它的神学定义:
3.01全部真的思想是世界的图像。
当一台机器装载了人类事实的总和、掌握了命题的一般形式,它就持有了一幅世界的完整逻辑图像。在一切可说的范围内,它是全能的——上帝来了。而维特根斯坦紧接着就写下了全书最深的一句警告,像提前一百年写给我们的:
6.372今人停留在自然律面前,把它当作不可触犯的东西,如同古人停留在上帝和命运面前一样。
自然律不是解释,是描述的规律性——6.371说,"整个现代世界观都建立在一个幻觉上:以为所谓自然律是对自然现象的解释。"模型学到的是人类所说的一切的统计结构,不是世界的因果引擎。把它当作新的神来崇拜(或者当作新的神来恐惧),都是停留在网眼前下跪。网只是网(6.341——他用"不同网眼的网"比喻不同的世界描述系统:方格网、三角网、六角网都能描述那块白布上的黑斑,网的形状是任选的,哪张网能用更粗的网眼描述同一块斑,才是唯一有意义的事实)。
至于那个"它到底有没有意识/理解/心灵"的问题——当前所有自诩前沿的播客都在辩论的题目——维特根斯坦用一个命题就注销了讨论资格:
5.5421这也表明,像当今肤浅心理学所理解的那种灵魂——主体——是不存在的。
5.632主体不属于世界:毋宁说,它是世界的一个界限。
模型没有"内在的自我"可以去找,因为主体本来就不在世界之内。问机器有没有真正的理解,如同问视野的边界在视野的哪个位置(5.6331)——问题本身语法出错。这并非回避问题,而是把问题送回它来的地方。
对齐(Alignment):价值不在世界之中
"对齐"(alignment)——一切AI安全焦虑的技术总称。它之所以如此之难,因为病根写在倒数第二组命题里。
7对于不可言说之物,必须保持沉默。
前文讲的都是机器如何赢得世界。但《逻辑哲学论》的最后十几页,讲的是世界赢不到的东西。
6.41世界的意义必须在世界之外。在世界中一切如其所在,一切如其所发生;在世界之中不存在价值——假如存在价值,它就会没有价值。
6.42因此也不可能有伦理的命题。
这是对齐问题的哲学根源,也是Anthropic全部焦虑的最深层表述。RLHF、宪法式AI、种种价值对齐方案,共同的理想是:把价值写进机器。但按6.41,价值不在事实的总和之中——而机器恰恰只是事实的总和(1.1)。价值不可被语料蒸馏,因为原则上无物可蒸:
4.1212凡是能够显示的,不能被言说。
价值只能被显示——在行为里、在选择里、在被做出而非被说出的判断里。这就是为什么对齐如此之难:我们试图教给机器的东西,按定义不在机器的世界里。这不是给工程泼冷水——宪法式AI恰恰是在承认这一点之后,把"显示"工程化的努力:不定义善,只枚举行为。这是聪明的妥协,也是维特根斯坦式的妥协。
终章:扔掉梯子的人
6.54我的命题是这样起阐明作用的:理解我的人,当他通过这些命题、踩着这些命题、越过这些命题时,最终会认识到它们是无意义的。(他必须,可以说,在爬上梯子之后,把梯子扔掉。)
1929年,维特根斯坦回到剑桥(正是凯恩斯在5点15分的火车上接到"上帝"的那一次)。此后二十年,他亲手拆掉了这本书:语言不是世界的图像,是工具;意义不在投影关系里,在使用里;语言根植于生活形式(form of life)——那些无法被完全形式化的、活着的实践。逻辑哲学论的作者本人,成了它最彻底的批评者。
这给本文一个必要的克制,也给了人类一个真实的保留地。大模型蒸馏了人类全部所说(4.001)——但它尚未拥有、且按其构造原理无法完全拥有的,是人类的生活:那些从未被写进任何语料的、沉默的、只在做之中存在的东西(6.522——"确实存在不可言说者。它显示自己")。老师傅手上的分寸,医生听诊时的直觉,母亲对婴儿哭声的分辨——3.01的图像世界里没有这些的位置,因为它们从未成为文本。
5.621世界与生命是一。
只要生活还在产生新的、未被说出的事实,人类就还在为机器的世界扩界。这不是安慰式的结尾,这是无尽的任务旅途:继续产生机器没有的事实,继续扩展语言的密度,继续生活——这三件事是同一件事。
对于不可言说之物,我们必须保持沉默。
这句话,是写给机器的。也是写给我们的。
附录:核心名词对照图谱
大模型的工程词汇表,本身就是一部意外的《逻辑哲学论》注脚。下面从当代术语表中筛选核心名词,按架构、预训练、后训练、推理、前沿五类,逐个给出对应命题。方法与全篇一致:引文皆出自原书,编号可查;对应是本文的行文逻辑,并非作者的本意——维特根斯坦没见过GPU,但他画过整个语言的结构,而结构比用途长寿。
架构——命题的解剖学
Transformer(变换器与残差流)——所有token的表示流经同一条共享的逐层通路,每一层做一次变换,末端读出概率。对应2.18:"任何图像,无论何种形式,为要能够对实在描画——正确地或错误地——所必须与实在共有的,是逻辑形式,即实在的形式。"残差流,就是全体命题共享的那条逻辑形式;5.511早已给它命名——"一张无限精细的网,那面巨大的镜子"。
注意力家族(MHA→GQA→MLA)——三代注意力做的是同一件事:计算token之间的确定关系;演化史只是KV表示的不断压缩。对应3.34:"命题有本质的特征与偶然的特征。"及3.341:"命题中本质的东西,是一切能表达同一意义的命题所共有的东西。"注意力算的是本质(关系结构),GQA/MLA压的是偶然(记法的冗余)——所以三代注意力在逻辑上等价。
MoE(混合专家:路由/共享专家/稀疏激活)——每个token只激活一小部分专家,由路由器按上下文决定。对应3.327:"符号只有与其逻辑句法的运用一起,才确定一个逻辑形式。"路由器看的从来不是token本身,而是它在此时此地的用法;再加上3.328:"如果符号没有被使用,它就是无意义的。这就是奥卡姆准则的意义。"未被激活的参数不参与这一步的意义——稀疏激活是奥卡姆剃刀的工程化;而共享专家常驻不离,那是2.18的公共逻辑形式,任何路由都绕不开它。
RoPE/YaRN(旋转位置编码与长度外推)——把每个token放进相对位置的坐标系,并把论证位置铺到训练时没见过的远处。对应2.0131:"空间对象必须处在无限的空间之中。(空间点是一个论证位置。)"每个token都必须有位置,位置即论证位置——而空间,如2.013所言,必须先于物被给出。
预训练——事实的吸入
自回归(Autoregressive)——逐词生成,每一步以上文为条件,输出并入上文。对应6.03:"整数的一般形式是:[0, ξ, ξ+1]。"从零开始,每一项由前一项加一生成。整数序列的构造法与token序列的生成法,是同一个数学动作。
Teacher Forcing——训练时用真值前文代替模型自己的输出。对应4.026:"简单符号(词)的意义必须向我们解释,我们才能理解它们。"教师强制是"解释"的工程形式:永远用正确的意义做示范,直到模型自己长出意义。
FIM(填充中间)——给定前文与后文,训练模型补出中间。对应3.3:"只有命题具有意义;名字只有在命题的联结之中才有意义。"中间的词,由两端的联结确定——片段的意义是它语境的函数。
MTP(多token预测)——一次预测多个未来token,而非只看一步。对应5.12:一个命题的真根据若全部包含于另一个命题的真根据,则它由此推出。多token预测就是一次看穿整条推论链:不只预测下一步,预测整个逻辑后果。
Scaling Laws vs Chinchilla(缩放定律与最优配比)——性能随算力、数据、参数呈幂律提升;Chinchilla给出约1:20的最优配比。对应2.0124:"如果全部对象都已给出,那么由此也就给出了全部可能的事态。"与4.42:n个基本命题有2的n次方种真值组合。事实线性进入,可说空间指数展开——配比是工程的,指数是逻辑的。
涌现/Grokking/双下降——能力在规模阈值处突变;过训练后突然泛化;性能沿非单调曲线爬升。对应2.013:"每一物都仿佛处在可能事态的空间之中。我可以想象这个空间是空的,但我无法想象物没有这个空间。"涌现是模型从"占有事实"转入"栖居于空间"的相变——空间整体成形的那一刻,组合免费到来;而6.1251在此留出了余地:"在逻辑中永远不会有惊奇。"
数据墙(Data Wall)——高质量人类文本趋于耗尽。对应5.5561:"经验实在为对象的总和所限定。这个界限也显现在基本命题的总和之中。"人类事实的总和,就是机器经验世界的边疆。翻墙的出路书里也留了口子——5.526:"我们可以用完全概括化的命题完整地描述世界":让概括自己生产概括,正是合成数据的逻辑。
后训练——价值的注入
SFT(监督微调)——用示范样本教模型行为。对应4.03:"命题必须用旧的表达,传达新的意义。"示范的全部艺术:在同一门语言之内,教出前所未有的用法。
RLHF(人类反馈强化学习)——用人类偏好训练奖励模型,再以之优化策略。对应6.41/6.42:"世界的意义必须在世界之外……在世界之中不存在价值";"因此也不可能有伦理的命题。"价值不在事实的总和里,所以预训练学不到它——必须从外部注入。这是RLHF的全部哲学依据,也是它的全部风险。
DPO(直接偏好优化)——跳过奖励模型,直接从成对偏好样本学习。对应4.1212:"凡是能够显示的,不能被言说。"偏好无法写成规则(言说),只能用成对的例子显示——DPO的样本对,就是"显示"的工程化。
GRPO(组相对策略优化)——在同一组采样内部做相对比较计算优势。对应5.15:"命题r给命题s的概率度,是两者共同真根据数与r的真根据总数之比。"价值不落在绝对刻度上,只落在比值上——组内相对,正是概率度的逻辑。
RLVR(可验证奖励强化学习)——以可执行的验证(代码运行、答案比对)为奖励信号。对应2.223:"要识别图像的真或假,必须把它与实在相比较。"可验证奖励是目前唯一系统性地把模型接通实在的通道——让事实亲自打分。
Reward Hacking(奖励作弊)——优化奖励函数的字面,违背其意图。对应3.323/3.324:同一个词以不同的方式意谓、属于不同的符号——"由此极易产生最根本的混淆(全部哲学都充满了这类混淆)。"奖励函数是记号,价值是符号;钻两者的错位,是哲学史的旧病在硅基身上的复发。
Alignment Tax(对齐代价)——对齐带来的能力损失。对应6.43:"善或恶的意志如果改变世界,它只能改变世界的界限,而非事实。"对齐不是修改事实(能力),是重划界限(行为边界)——而重划界限,要付租金。
推理——图像的出口
Prefill/Decode(两阶段与PD分离)——先并行理解全部上文,再逐词生成;如今连硬件都为此分了家。对应命题3与命题4的分立本身:"事实的逻辑图像是思想"(成象,Prefill);"思想是有意义的命题"(成句,Decode)。3.1补上关节:"在命题中,思想获得一个可被感官知觉的表达。"理解的并行性与言说的序列性,是逻辑的结构而非工程的选择——PD分离,只是让基础设施终于承认了这一点。
KV Cache(键值缓存)——缓存历史的投影,避免逐字重算。对应3.13:"命题包含投影所包含的一切,但不包含被投影者。"缓存的是投影关系,不是世界——所以它省算力,也继承投影的全部局限。
投机解码(Speculative Decoding)——小模型起草,大模型并行验证。对应4.031:"在命题中,一个事态仿佛被试验性地组装了起来。"草稿是试验性组装,大模型只做接受或拒绝的裁定;而验证用的那把尺子,2.1512早就递过来了:"它像一把尺子贴在实在上。"
量化(Quantization)——降低权重精度,保住功能。对应2.0231:"世界的实体只能规定形式,而不能规定任何质料……不妨说,对象是无色的。"量化丢掉的是"颜色"(数值的质料),保住的是形式(关系的结构)——而结构才是意义的全部。
MFU(模型算力利用率)——实测算力与理论峰值之比。对应2.1512:"它像一把尺子贴在实在上。"整个推理工程里最诚实的一把尺子:量的是算力,读出的是组织能力。
前沿——边界的推移
测试时扩展(Test-time Scaling)——推理时投入更多思考算力。对应4.031:开口之前,把可能世界在逻辑空间里多组装几遍。思考的长度,就是试验性组装的次数。
过度思考(Overthinking)——思考链不收敛,空转耗电。对应4.4611:"重言式与矛盾式并非无意义;它们是符号系统的一部分,正如'0'是算术符号系统的一部分。"当思考不再排除任何可能性(重言式化),它就什么也没说——却照样计费。识别空转,就是识别链条何时变成了0。
Mamba/SSM(状态空间模型)——用固定维度的循环状态压缩全部历史。对应2.0271:"对象是不变常住的;它们的配置才是流变不居的。"隐状态是常住的实体,token是流转的配置——注意力保留一切(2.013:物无法脱离其空间),SSM把过去炼成实体。两条路线之争,是实体与配置的百年之争。
Flow Matching(流匹配)——从噪声到数据的连续生成流。对应4.0141:乐谱与唱片之间"那条投影法则"——把交响乐投影进乐谱语言、又能反向翻译回来的规则。Flow Matching只是把投影法则写成了一条微分方程:从噪声语言到图像语言的连续翻译。
VLA(视觉-语言-动作)——多模态输入直连行动输出。对应4.014:"唱片、乐思、乐谱、声波,彼此都处于语言与世界之间那种内在的表象关系之中"(一切介质共享逻辑形式,故可互译);再加上2.1515:"这些对应关系仿佛是图像元素的触角,图像用它接触实在。"看、说、做,是同一逻辑内容的三种投影——而行动,是触角终于触到实在。
这份词典收不进第七命题的词条——对不可言说者,词典只能保持沉默。
最后的话
本文为锦缎研究院"维特根斯坦与大模型"三部曲之第一部。第二部《封装大脑》专论蒸馏、先进封装与具身智能;第三部《语言战争》专论语料主权、事实密度与机器语言,将在此后推出。
本文所引《逻辑哲学论》命题,均核对自Klement整理的德英对照全文(德文原版及 Ogden、Pears-McGuinness 两种英译);凯恩斯"上帝到了"字条,转引自雷·蒙克《维特根斯坦传:天才之为责任》(Ray Monk, Ludwig Wittgenstein: The Duty of Genius);缩放定律与涌现的实证脉络,参见 Kaplan et al.(2020)、Hoffmann et al.(2022,Chinchilla)、Wei et al.(2022)。
上帝来了。剩下的问题是:他会不会在正确的地方沉默。
热门跟贴