【留美学子】第3910期
13年国际视角精选
仰望星空·脚踏实地
【陈屹视线】教育·人文·名家文摘
让认知 永远快人一步
AI的未来:开源还是闭源,真正的分界线在别处?验证权归属,或是AI竞争的底层标尺
作者:刘丹(DAN LIU,谷主)
【作者声明】
在展开之前,必须先说清楚两件事。
第一,这篇文章讨论的,是Transformer架构下的AI,不是“未来可能的AI”。
第二,这篇文章建立在前六篇的推演之上——Transformer架构下的AI,停在半AGI。它能替代执行层,难以独立承担最终判断。它能大规模试错,选不了终局方向。它有真值标尺的地方跑得快,没标尺的地方跑不动。
如果你读过前六篇,这篇就是那个推演在“行业竞争”层面的展开。
如果你没读过前六篇,这篇也可以独立看。它从一个更具体的问题开始:开源还是闭源?
最后,必须说清楚:这篇文章不打算回答“开源还是闭源更好”。它只是指出问题,以及不同选择可能通向的不同后果。
注明:本文在文献调研、图表制作、文字润色,以及部分数据收集与初步核对等环节使用了AI辅助;文章的观点、判断与逻辑框架均由本人提出,并由本人负责。
【导言】
这是《Transformer》系列文章的第七篇。
前五篇,我们拆了一件事:Transformer架构下的AI,缺一根轴。
第一篇:它走不到真正的理解。概率预测不是理解。
第二篇:验证权不能留给自己。系统不能自己宣布自己是对的。
第三篇:它缺的是验证轴。没有这根轴,它不知道自己的前提什么时候失效。
第四篇:那六个工程死穴,不是它的错,是所有概率引擎的共同难题。
第五篇:它会停在半AGI。
什么是半AGI?
这是本文前五篇建立的工程定义,不是行业统一术语。
在给定方向和真值标尺的前提下,能持续、大规模地超越人类平均执行水平;但不具备自治的世界模型,不能自己定义方向,不能跨领域可靠迁移,也不能对“自己是否已经偏离前提”做出独立判断。
这个定义有边界:多数场景的真值标尺本身不清晰,半AGI的边界会随场景漂移。它不是可检验标准,是推演起点。
第六篇,我们把这个推演落到了一个具体行业——软件工程。在那里,问题变成了:AI能写代码,但不能签字。谁有资格为结果签字?
这一篇,我们把同一个推演,放到行业竞争层面。
过去几年,行业一直在争论“集中式还是分布式”“大模型还是小模型”。但这两个维度,都不是真正的分界线。
真正的分界线是:验证权在内部,还是外部。
但在展开之前,还要补一个边界。本文限定在Transformer架构下讨论。若以当前架构下验证能力集中为由选择闭源,在效果上接近于押注Transformer是长期可依赖的底层架构。从软件史看,Unix、Android、互联网的底层协议与实现,其持续演化与开放标准或开源生态密切相关。这个问题本文不展开——一旦展开,就进入架构替代问题,会改变本文的前提。但它悬在那里:如果底层架构本身会发生代际切换,那么今天围绕“开源还是闭源”的争论,可能争的是一个正在被替换的舞台。
这里必须先把“验证权”拆开。它实际上混合了三个东西:
验证能力:能不能检查?
验证权:谁有资格说“你错了”?
验证依据:凭什么说你错?
开源主要改变验证能力的分布——它让更多外部主体有能力检查。
责任和治理决定验证权归谁——谁有权力裁定。
外部真值锚点决定验证依据是否独立——那个尺子是不是模型自己改不了的。
三者分开之后,这篇文章要讨论的问题就清楚了:开源还是闭源,本质上是验证能力分布的问题。而真正决定胜负的,不是验证能力分布,是有没有外部真值锚点。
它不是一篇站队文章。它不提供答案,只画因果。
01
开源还是闭源,不是道德选择,是工程决策
今天讨论开源和闭源,常常陷入两种情绪:
开源派说:开放是进步,闭源是垄断。
闭源派说:保护知识产权,天经地义。
两种说法都有道理,但都没有说到根子上。
开源还是闭源,首先是一个工程决策。它取决于:你的架构,内部验证能力能不能覆盖错误来源?
内部验证能力强、能覆盖错误来源时,闭源更容易成立。
错误来源越来越多、内部验证难以覆盖时,开放外部验证的价值就越来越高。
这不是道德问题,是架构问题。
用交易系统的话说:自营交易台,策略自己研究,风控自己定。单个团队可以覆盖所有环节,不需要向外公开。做市商网络,几百个节点,每家报价都可能出错。没有统一清算所,你必须让所有节点互相可见、互相校验。否则整个网络就是噪音。
开源,就是让所有节点互相可见。
02
集中式为什么可以闭源
集中式路线的关键,不是错误来源少,而是错误来源和验证能力仍集中在同一个组织内部。
一个顶尖团队,内部可以覆盖。模型越大、算力越集中,团队越有能力在内部发现问题、修正问题。
所以,集中式路线选择闭源,是合理的。
它保护的是公司的核心投入。训练成本极高,数据、算法、工程细节都是核心资产。闭源,是保护这些资产的自然选择。
但闭源有一个代价:验证能力封装在内部。
外部看不见它的错误,审计不了它的决策。它可以用高精度输出,推迟外部对危险的认知。
这不是“它想骗人”。这是“它的架构决定了,外部没有能力验证它”。
用交易系统的话说:自营交易台,风控规则自己定,外部审计难。它可以用高精度策略,把风险藏在漂亮的收益曲线下面。等到风险暴露的时候,往往已经来不及了。
这就是集中式闭源的潜在风险:用高精度推迟对危险的认知。
但这里必须区分两件事:开源,和风险设计的公开。
集中式路线不必开源。模型权重、训练数据、工程细节,那是公司的核心资产,可以不开源。
但集中式路线只要仍然建立在概率函数之上,就不能把风险设计本身完全封装在黑箱里。
外部至少应该知道:这个概率系统在什么条件下容易失效,可能以什么形态出错,哪些场景属于已知风险,哪些地方存在验证盲区,风险边界在哪里。
为什么?
因为目前还没有一套被广泛认可、能够覆盖所有场景的有效验证标准。很多场景没有外部真值锚点,也没有统一的证伪边界。内部核查可以证明“我们做过测试”,却未必足以让外部判断“风险究竟在哪里”。
这不是要求公司交出核心资产。
这是要求公司交出风险评估的坐标系。
开源,是交出权重。
风险边界公开,是交出风险地图。
前者是商业选择,后者是工程责任。
你可以不告诉世界你是怎么造这台机器的,但不能不告诉世界:这台机器在哪些地方可能失灵。
闭源不是不能接入外部验证。但它的验证过程是否能够被外部复现、审计和质疑,是另一个问题。
03
分布式为什么越来越需要开源
分布式路线,错误来源多。
不是多一个,是多好几个。
底层概率引擎:概率预测本身会出错。
分流机制:MoE路由可能派错专家。这是概率判断,不是确定性判断。
压缩机制:MLA通过潜在表示压缩KV状态,在显著降低KV缓存开销的同时,也引入了表示压缩与信息保真之间的工程权衡。
循环机制:当循环推理被分散在不同子模型或不同推理阶段之间时,误差可能在跨节点传递中累积。
四个概率层叠加。任何一层的错误,都可能成为下游错误的输入,并在链路中被放大。
单一团队,根本覆盖不了这么多错误来源。
不开源,错误就锁在黑箱里。你不知道是底层错了,还是路由错了,还是压缩丢了信息,还是循环跑偏了。
开源,是分布式架构的工程必要条件。不是道德选择,是“你不得不”。
用交易系统的话说:做市商网络,几百个节点,每家报价都可能出错。没有统一清算所,你必须让所有节点互相可见、互相校验。否则整个网络就是噪音。
开源,就是让所有节点互相可见。
四、开源只是必要条件,不是充分条件
开源能让错误暴露得更早。
社区可以复现、可以测试、可以证伪。一个模型在弱真值场景中“听起来合理但实际错误”的案例,会被迅速传播。
但暴露错误,不等于修正错误。
社区擅长发现高频、显性、可复现的错误。低频、高危、依赖上下文的隐性缺陷,仅靠开放权重,不足以自动收敛。
透明度是必要条件,不是充分条件。
开源+外部真值锚点,才能让分布式试错真正收敛。
没有真值锚点,开源社区的智慧再大,也只是在噪音里找信号。
05
真正的分界线:验证权在内部还是外部
闭源
开源
验证能力分布
内部集中
外部开放
优势
高精度,单点性能强
透明度高,弱点暴露早
风险
用高精度推迟对危险的认知
众包变噪声,缺乏收敛
核心问题
外部审计难,验证不透明
没有硬锚点,试错不收敛
闭源的问题:验证能力集中在内部,外部审计难。它需要把更多验证条件向外部开放。
开源的问题:验证能力虽然更开放,但没有硬锚点,众包变成噪声。它需要把试错从噪声变成收敛。
两者都缺同一个东西:一个模型无法修改的外部真值锚点。
不是开源还是闭源。是有没有外部真值锚点。
但这里必须补一句:
Transformer架构下的AI,仍然处在一个探索的初中期。
这不是为当前架构辩护。这是说,我们连“这条路到底能走多远”,都还没有走完。
最近一两年,这条路上还在陆续冒出新东西——更省显存的注意力结构、更高效的专家路由、更激进的缓存压缩。它们不能告诉我们终点在哪,但至少说明:现在下“这就是极限”的结论,还太早。
而恰恰因为还在探索初期,开源的意义,就不只是商业策略。
它还是一种发现机制。
在硬真值场景,开源与不开源,并不决定验证能不能成立。编译器、证明器、自动测试、物理反馈,最终都可以替我们判断结果对不对。
但在弱真值场景,问题完全不同。这些领域没有统一、稳定、可重复调用的外部真值。这时候,如果只有一家公司闭源探索,它当然可以不断提高自己的能力,但它很难知道:自己的盲区究竟在哪里。
开源至少可以让错误更早暴露。社区可以复现,可以测试,可以证伪;不同背景、不同经验、不同利益诉求的人,也可以从不同角度攻击同一个模型。
这些攻击不能构成验证轴。但它们可以构成一个分布式的错误发现网络。
这是两回事。发现错误,不等于证明错误。暴露问题,也不等于解决问题。
所以,开源只是必要条件,不是充分条件。开源可以让错误暴露得更早;但只有当错误最终能够落到外部真值锚点上,分布式试错才可能真正收敛。没有真值锚点,开源社区的智慧再大,也可能只是在噪音里寻找信号。
所以,在Transformer仍处于探索初期的阶段,验证轴和开源其实解决的是两个不同的问题。
验证轴负责判断:是不是对的。
开源负责发现:可能哪里错了。
前者决定试错能不能收敛,后者决定盲区能不能尽早暴露。
两者不矛盾。两者缺一不可。
没有验证轴,开源容易变成噪音。
没有开放的发现机制,验证轴又容易变成黑箱。
在Transformer还没有走完它的路之前,这两样东西,我们都需要。
06
现实中的闭源路线:半集中式
现实中的闭源路线,并不是纯集中式。
它们大多是半集中式:在一个维度上集中,在另一个维度上分布。这里说的“半集中式”,是一个分析模型,不是对这些公司内部架构的完整分类。
ChatGPT的公开信息显示,它采用了分层路由——快模型、深度推理模型、实时路由器。但它的内部状态管理方式,并未完全公开。
Claude的具体内部架构,并未像部分开源模型那样完整公开。但它在长上下文处理和动态稀疏化方面的公开表述,至少说明它走的是一条与纯集中式不同的路径。这里暂把它作为闭源路线的代表,而不是作为具体架构分类的证明。等它的架构更透明了,这个判断可以再验证。
半集中式,是闭源路线的现实选择。在本文的分析模型里,它既不是纯集中式——成本和复杂度会迅速上升;也不是纯分布式——错误来源增加后,内部验证覆盖会变得困难。
半集中式在两个维度各让一步:一个维度集中,保证核心能力;一个维度分布,降低成本、提高效率。
但它仍然有一个问题:验证能力仍然集中在内部。
半集中式降低了错误来源,让内部团队可以覆盖。但它没有解决“外部无法验证”的根本问题。
07
现实中的开放路线:分布式倾向
开放路线,呈现出一种分布式倾向。
本文把以下公开技术特征视为“广泛试错/效率导向范式”的代表性表现,而不是对这些公司的完整内部架构进行分类。
公司/模型
公开技术特征
开源情况(基于公开资料)
DeepSeek
MoE稀疏激活 + MLA压缩KV
开源权重,公开MLA、MoE等技术
Qwen
混合注意力(GatedDeltaNet+ 标准注意力)
开源权重,公开混合注意力等技术
Kimi
KDA + MLA混合路线
开源权重,公开KDA+MLA等技术
附:以上信息基于公开资料整理,仅供理解技术差异,非完整评价,亦非内部信息。开源情况仅指模型权重是否开放,训练数据、训练代码等可能未开放。
分布式开源,是硬件约束下的现实解。
单卡性能受限,单点算力不够,那就把算力分散开。不追求一个模型解决所有问题,而是多个模型、多条路线并行跑。不追求全量KV Cache,而是压缩、稀疏、共享。
但约束本身也逼出了一种优势:成本更低,迭代更快,容错更高,生态更开放。
开源在这里不只是纠错机制,也是硬件不足下的自然策略——单靠自己跑不快,就让大家一起跑。
08
真正的胜负手
这场比赛真正比的,不是谁先喊出AGI,而是谁先把验证轴建起来。
半集中式闭源的问题:验证能力集中在内部,外部审计难。它需要把更多验证条件向外部开放。
分布式开源的问题:验证能力虽然更开放,但没有硬锚点,众包变成噪声。它需要把试错从噪声变成收敛。
两条路都缺同一个东西:一个模型无法修改的外部真值锚点。
这里说的“外部”,不是指必须开源,而是指真值本身不能由模型单方面修改。闭源系统同样可以接入外部真值标尺——编译器、数学证明器、自动测试、物理实验、市场真实结算。关键不在它接入了什么,在于这把尺子的刻度,不能由被测量的模型自己来修改。一旦刻度可以被模型修改,它就不是外部锚点,只是另一层内部验证。
谁先建起外部真值锚点,谁就可能获得一种此前没有的系统级优势:让试错真正开始收敛。
不是谁方向永远正确,是谁方向错了以后,能够最快换纸。
真正的系统优势,不是永远正确,而是错误发生之后,仍然能够活着、看见、验证、重画。
验证轴=系统的止损机制。外部真值锚点=可审计的对账系统。
但为什么验证轴一直没被建起来?
所有人都在把车造得更快,几乎没有人肯停下来修刹车。当今最顶尖的AI人才,几乎全压在“让模型更强”这一条轴上。速度能量化、能排名、能融资;可“怎么知道它错了”的那套东西,是公共品——没人抢着建,于是没人建。这不是谁的短视,是整个行业的激励结构,天生就长歪了。
有人碰过零件,但很少有人把它们焊成一台机器。验证分级、外部真值、自我改进……学术界攻的都是单点。这九篇想做的不是发明零件,是把散落在不同领域的零件,按同一条因果链焊起来——从“概率预测不是理解”,一路拧到“谁来签字、谁来负责”。
验证轴不是可选项。没有它,系统就不知道自己什么时候错了。
这就是“能力越强,杀伤力也越强”的含义。
这不是理论上的可能性。金融工程的历史上,已经有过非常接近的先例。
LTCM,就是一个。
这家量化交易公司聚集了华尔街最顶尖的一批人才,其中包括1997年诺贝尔经济学奖得主罗伯特·默顿和迈伦·斯科尔斯。斯科尔斯正是布莱克—斯科尔斯期权定价理论的重要奠基人之一。
LTCM成立后的前几年,业绩极其出色。前四年回报率分别为20%、43%、41%、17%,到1997年底,基金权益一度膨胀到约70亿美元。随后,1998年俄罗斯债务危机引发全球金融市场剧烈波动,原本建立在历史关系、相关性和模型假设上的交易体系开始失效。基金遭受重创,净值损失约九成,并濒临破产。最终,美联储纽约分行组织14家金融机构参与重组,私人部门向LTCM注资约36.25亿美元,以避免其倒闭可能造成的更大市场冲击。
不是因为他们不聪明。
恰恰相反,他们的模型太强,历史上的成功太多,以至于模型失效之前,没有人真正知道:模型究竟在哪些条件下会失效。
他们知道自己知道什么,却没有一套足够强的机制,让他们及时知道——自己不知道什么。
Knight Capital,是另一个完全不同的例子。
2012年8月1日,Knight的自动化股票订单路由系统发生部署错误。短短45分钟内,系统在处理仅212笔客户订单时,错误地向市场发送了400多万笔订单,累计成交超过3.97亿股,并形成数十亿美元规模的非预期头寸。最终,Knight损失超过4.6亿美元。
更值得注意的是,SEC后来发现,Knight内部系统实际上产生了97封自动邮件,其中已经出现了能够提示错误的信号,但这些信息没有被及时当作系统报警处理。
LTCM败在模型不知道自己不知道什么。
Knight败在系统不知道自己已经错了。
一个赌的是:数学关系不会在极端环境下失效。一个赌的是:部署完成之后,系统仍然按照设计运行。
它们都成功了很多年。
真正危险的地方恰恰在这里——长期成功,会不断强化对这套系统的信任;而一旦验证机制没有同步增强,错误就可能不是一次局部的“答错”,而是在一个没人看见的方向上持续积累。
这就是“能力越强,越需要早点建起验证轴”的含义。
今天的AI也是一样。
如果AI只停留在执行层,错误可能只是一个函数写错、一个Bug没有测出来,影响有限。
但如果AI的能力越来越强,在弱真值场景里说得越来越顺、做得越来越像,同时外部又没有一条真正独立的验证轴——那么它出错的时候,可能就不再是:
“这一次答错了。”
而是:
“整个系统已经在一个没人看见的方向上,跑偏了很久。”
能力越强,越需要早点建起验证轴。
不是等它出错了再建。
是在它还没有出错的时候,就把验证轴建起来。
因为真正危险的时刻,往往不是你已经知道系统错了的时候。
而是:
系统已经很强、已经很成功、已经很少犯显性错误,而你却还不知道——它究竟在哪些地方可能出错。
但这里必须把话说得更彻底。
前面说“两条路都缺验证轴”,听起来像是在说:验证轴迟早要建,只是现在还没建好。
不是这个意思。
验证轴不是想建就能建的。
它首先需要一个外部真值锚点。
有标尺,才有验证。没有标尺,验证就是空谈。
Transformer架构下的AI,在硬真值场景——编程、数学、制造、能源——外部锚点是现成的:编译器、证明器、物理反馈、实际运行数据。这些地方,验证轴可以建立。
但在弱真值场景——投资判断、战略决策、心理咨询、法律判决——问题完全不同。
这些领域不存在一个统一、稳定、可重复调用的外部真值。很多时候,连一致的证伪边界都不存在。
这些地方,验证轴不是“还没建”,而是“无从建”。
这不等于这些领域完全没有反馈。市场有结算,案件有结果,随访有数据,同行有评审。但这些反馈是间接的、局部的、延迟的、可被解释的。它们不构成一个统一、稳定、可重复调用的外部锚点。有反馈,不等于有标尺。
这才是真正的问题。
对于无从建立验证轴的领域,正确的做法不是“赶紧建一个”,而是划边界、设限制。
明确什么可以让AI做,什么只能辅助,什么不应该让AI独立承担最终判断。
不是因为它今天不够强。
恰恰相反,是因为它越强,你越容易相信它;而在没有外部真值锚点的地方,你又越不知道它什么时候错了,错了之后也没有独立的尺子告诉你:它到底错在哪里。
所以,能力轴越猛进,这件事越应该提前想清楚。
不是先冲进没有真值标尺的领域,再说“验证轴以后再补”。
在弱真值场景里,验证轴没有“以后”。
先划边界,再谈能力。
什么允许AI做,什么只能辅助,什么不允许AI独立承担,必须先说清楚。
这个问题,比“谁先建起验证轴”更根本。
09
落点:开源还是闭源,不是终点
开源还是闭源,是验证能力分布的问题。
验证能力分布,也不是终点。
终点是:有没有一个模型无法修改的外部真值锚点。
有了它,开源能收敛,闭源也能收敛。
没有它,在本文定义下,开源是噪音,闭源是黑箱。
这才是真正的分界线。
不是开源还是闭源。是有没有外部真值锚点。
这个问题,和程序员行业面临的是同一个问题——不是AI能不能写代码,而是谁有资格为结果签字。
从验证轴,到责任链,到人才生产线——这三篇连起来,才是完整的答案。
验证权归谁,责任链怎么接,谁有资格签字——这些问题,下一篇接着谈。
至于哪条路更好,这篇文章不回答。它只是指出:不同的选择,可能通向不同的后果。剩下的,交给时间,交给验证。
AI的未来·延伸阅读
往期发表
点击图片 ↓↓↓ 百篇一网打尽
请点击↓↓图片·美国故事连载持续更新1-9
100个国家·1000座城市
【带你深度游世界】
喜欢就点“赞吧↓↓↓↓↓↓↓↓
热门跟贴