【留美学子】第3908期

13年国际视角精选

仰望星空·脚踏实地

【陈屹视线】教育·人文·名家文摘

让认知 永远快人一步

AI的未来:程序员何去何从?
谁签字:真值标尺下,一个行业的推演

作者:刘丹(DAN LIU,谷主)

【作者声明】

在展开之前,必须先说清楚两件事。

第一,这篇文章讨论的,是Transformer架构下的AI,不是“未来可能的AI”。

第二,这篇文章建立在前五篇的推演之上——Transformer架构下的AI,停在半AGI。它能替代执行层,难以独立承担最终判断。它能大规模试错,选不了终局方向。它有真值标尺的地方跑得快,没标尺的地方跑不动。

如果你读过前五篇,这篇就是那个推演在一个具体行业里的落地——软件工程。

如果你没读过前五篇,这篇也可以独立看。它从一个更具体的问题开始:谁签字?

注明:本文在文献调研、图表制作、文字润色,以及部分数据收集与初步核对等环节使用了AI辅助;文章的观点、判断与逻辑框架均由本人提出,并由本人负责。

【导言】

这是《Transformer》系列文章的第六篇。

前五篇,我们拆了一件事:Transformer架构下的AI,缺一根轴。

第一篇:它走不到真正的理解。概率预测不是理解。

第二篇:验证权不能留给自己。系统不能自己宣布自己是对的。

第三篇:它缺的是验证轴。没有这根轴,它不知道自己的前提什么时候失效。

第四篇:那六个工程死穴,不是它的错,是所有概率引擎的共同难题。

第五篇:它会停在半AGI。

上述文章链接

系列 延伸阅读

什么是半AGI?

这系列前五篇建立的工程定义,不是行业统一术语。

在给定方向和真值标尺的前提下,能持续、大规模地超越人类平均执行水平;但不具备自治的世界模型,不能自己定义方向,不能跨领域可靠迁移,也不能对“自己是否已经偏离前提”做出独立判断。

这篇要补的,是半AGI在一个具体行业里的落地——软件工程。

即便在半AGI的程序员行业,也有上限。

打开网易新闻 查看精彩图片

一一顿免费午餐里的对话

今天我与夫人去谷歌纽约公司,约会一个好友的孩子,一起吃了午餐。他在谷歌干了快八年。

我问他:现在谷歌内部,AI程序员能到什么级别?

他说:目前大概在Lv2到Lv3之间。

我问:Lv5呢?

他想了想:似乎不可能实现。

这是一个人的经验判断,不是系统统计。但它指向的问题,是结构性的。

这里说的Lv2到Lv3、Lv5,是朋友基于自己工作经验的内部口语化判断,不是Google官方对AI能力的公开评级。

谷歌的工程师职级,是一条逐步扩大责任范围的阶梯。随着级别上升,代码本身的重要性逐渐下降,独立判断、项目负责和组织影响力逐渐上升。

L5是一个重要分水岭。从这一级开始,组织对你的期待变了:不再只是“把事做对”,而是“决定做什么事,以及为结果签字”。L6以上,这个“签字”的分量指数级增加。到了最高级别,签字的对象已经不是某个项目,而是整个公司的技术方向。

但这句话让我想到的,并不是AI今天究竟是L2还是L3,而是另一个问题:Lv5到底是什么?

Lv2到Lv3,是初级执行层——给明确需求,把代码敲出来。AI能干这个,而且干得不差。

Lv5,是资深工程师。它意味着独立负责模块、带项目、在模糊业务里拆架构,对系统上线后的生死稳定性兜底。

这不是写代码,是做判断。

AI能写代码,但在现行组织与责任制度下,不能作为最终责任主体签字。至少在现行组织与责任制度下,最终签字仍然落在人或由人控制的组织主体身上。

这个细节,决定了AI在软件工程里能走多远。

打开网易新闻 查看精彩图片

二写代码≠搞工程

谷歌级别里,L3/L4是“给明确需求,把代码敲出来”——AI已经能干。

L5开始,核心变了:在模糊业务里拆架构,在性能、成本、技术债之间做权衡,对系统上线后的生死稳定性兜底。

代码的终点,是运行。

工程的终点,是上线。

组织的终点,是责任。

谁批准上线?谁决定风险可以接受?谁知道什么时候必须停?谁在事故发生以后解释为什么当时这么决定?

真正的高级工程能力,不是代码写得最多,而是在不确定性中,仍然敢为一个决策签字。

打开网易新闻 查看精彩图片

三形式化验证能解决什么,不能解决什么?

今天的产业叙事正在把新的希望放在两个方向:更强的慢思考,以及更强的形式化验证。

这两个方向值得研究。但这里有一个必须区分的问题:封闭系统里的可验证成功,能不能直接推广到开放世界?

用围棋打个比方:19×19的棋盘,固定规则,零随机性,完美信息。AI可以通过自我博弈做出完美推理。但现实交通充满了突然冲出的外卖车、下雨天模糊的标线和情绪化的司机——你没法用一套确定性公式证明“这辆自动驾驶汽车绝对不会撞人”。

这里必须说明:当前自动驾驶系统的架构,并不是Transformer架构。它不是本文讨论的对象。

但它恰好是一个极好的参照:连专门为开放世界设计的、多种技术组合的自动驾驶系统,都无法被一套确定性公式完整验证——那么,一个以概率生成为核心、缺乏验证轴的Transformer系统,又凭什么能保证在开放世界里不出错?

更准确地说:开放世界系统,不存在一个可以提前穷尽所有未来状态的完整验证集合。

围棋的问题空间可以事先定义。棋盘、规则、胜负条件都是固定的。

现实工业系统不同。它面对的是一个开放世界:需求会变,环境会变,异常会变,利益相关者会变,甚至“什么算成功”本身都会变。

形式化验证很强,但它验证的是已经被定义出来的东西。

真正困难的是:谁来决定什么必须被验证?验证到什么程度才算够?哪些条件一旦失效,就必须推翻原来的方案?

开放世界无法像围棋那样,事先给出一个完整、封闭、稳定且无歧义的验证对象。

人类签字,也不是因为证明了绝对安全。人类是基于经验、冗余、保险和风险接受机制在做判断。

问题不是“能否保证不出错”,而是“出错后如何分配责任、如何控制风险”。

形式化验证解决不了这个问题。它只能验证已经被定义出来的东西。真正的判断,发生在定义之外。

这一步,才进入判断。

打开网易新闻 查看精彩图片

四
L5的标尺,不是技术问题

编译器能告诉你代码是否通过。

但“独立负责”到什么程度算达标?“架构设计正确”到什么程度算正确?“风险可以接受”又由谁定义?

这些当然可以建立评价体系,但它们很难拥有编译器那样单一、即时、客观、可自动判定的真值。

技术标尺可以越来越硬,组织判断却始终保留一部分灰度。

不是技术问题,是制度问题。

技术标尺能建,社会标尺可以不断硬化,但很难像编译器那样,把开放世界中的全部责任判断压缩成一个单一、即时、自动判定的真值。

人类的判断力,不是一种单一的学习方式。

文本学习——可抽象、可token化——只是其中一种。还有模仿学习、视觉学习、失败学习、环境学习。这些学习方式,目前还没有被很好地抽象化。

Transformer可以把“看着师傅做一遍,然后自己试一遍,摔了跟头,再试一遍”编码成token序列。但编码这个经历,不等于真正经历这个过程。

文本可以描述“摔了跟头再试一遍”,但描述不等于经历。真实经历,是判断力形成的重要来源。

这也是为什么,L5所需要的验证能力,不能只靠文本训练建立。判断力的核心部分,并不只存在于文本里,还存在于真实经历、真实反馈和真实后果中。

技术标尺可以很好地衡量代码能力、知识能力和一部分验证能力,却很难仅靠这些指标衡量一个人经历真实后果之后形成的判断力。

而这恰恰是L5最核心、也最难量化的一部分。

打开网易新闻 查看精彩图片

五责任锚点无法转移

软件工程的终点是责任。

AI当然可以写复盘报告,甚至可能比人写得更好。

但出了事故以后,谁对这份报告、这个决策以及由此产生的损失负责?

责任最终必须落到一个可以被组织、法律和社会追责的主体身上。

在现行制度框架内,责任锚点无法转移到AI身上。但制度可以改——法人制度在历史上就解决过“非自然人承担有限责任”的问题。

法人可以成为责任主体,但它背后仍然存在可以被追责的人和组织。

AI则不同。至少在现行制度框架下,它还不是一个能够独立承担最终法律、经济和组织责任的主体。

这里要区分两件事:事实上的决策参与权,和法律上的最终签字权。

AI可以拥有前者。它可以参与决策、提供建议、甚至主导方案。但在现行制度下,它拿不到后者。

问题在于:如果AI有事实决策权,却不承担最终责任,那责任链条就出现了缺口。谁为AI的决策兜底?是使用它的公司,是部署它的团队,还是批准它上线的人?

制度可以改。AI责任保险、强制审计日志、合规认证、赔偿基金——这些都不是幻想。

问题不是“制度能不能改”,是改的速度能不能跟上能力轴的速度。

你可以让AI拥有越来越大的决策参与权,但在现行制度下,最终责任仍然必须落到人或由人控制的组织主体身上。

打开网易新闻 查看精彩图片

六一个没人问的问题:Lv5都退休了,谁来签字?

如果谷歌的Lv5,是从Lv1一级一级干上来的,不是天上掉下来的——

那么十年后、二十年后,当今天的Lv5、Lv6、Lv7陆续退休,而Lv5以下的工作都由AI承担了,公司里还有谁有资格签字?

我问他:那按谷歌的职级,一个人从Lv1干到Lv5,一般要多久?

他说:快的五六年,慢的八到十年。大多数人,一辈子停在Lv5。

我又问:那AI呢?从Lv2-Lv3干到Lv5,你觉得要多久?

他想了想:可能永远不行。

我问为什么。

他说:因为Lv5不是写得快、写得好。是出了事,你敢不敢签、能不能扛。AI能写,但不能扛。而“能扛”这个东西,不是训练出来的,是摔出来的。你摔过,才知道什么叫扛。

我问:那给它模拟环境,让它摔呢?

他说:模拟盘里练不出盘感。你知道那不是真的,就不会真的承担那个后果。真的摔过,才知道什么叫扛。AI可以模拟摔,但它没有真正承担过那个后果。

Lv5不是学出来的,是干出来的。

独立负责的能力,是在无数次真实决策、真实后果、真实代价中长出来的。

如果Lv3、Lv4的执行层被AI全部接走,年轻人就失去了“干出来”的路径。

AI越强 → 执行越少 → 年轻人真实试错越少 → 判断力生产减少 → 高阶人才断层。

路径断了,Lv5就断代了。

真正可能拖垮公司的,不是AI替代了多少人,而是AI替代执行层之后,公司有没有能力继续生产下一代高阶人才。

这不是AI能力问题,是人才生产线问题。

而且这里还有一个更现实的挑战。

就算公司有意保留一些年轻人,让他们从Lv1到Lv5一级一级干上来,他们干得也不如AI。AI写得更快、更稳、更便宜。公司凭什么养一批干得不如AI的人,让他们慢慢练判断力?

这不是公司短视,是竞争压力。你留人练判断力,对手用AI跑量,你就在成本上输了。

所以,Lv5断代,不是AI直接造成的,是AI把执行层效率拉到极致之后,人才生产线失去了存在的经济理由。

旧路径断了,不等于新路径不存在。

但新路径要成立,必须绑定真实代价。没有责任绑定的训练,不是训练,是模拟盘。

审查AI代码,如果发现问题你签字放行、出了事故你负责——这是训练。如果只是提个建议、没人理你、后果与你无关——这是模拟盘。

设计测试,如果测试通过你签字上线、上线后出事你背——这是训练。如果只是跑跑用例、写写报告——这是模拟盘。

红队攻击,如果发现了漏洞但公司没修、出了事你追责——这是训练。如果只是出个报告、没人跟进——这是模拟盘。

关键不在做什么,在有没有责任绑定。

没有责任绑定的新路径,不叫训练,叫围观。围观再多,也长不出判断力。

问题不是“路径一定断”,是旧路径断了,绑定责任的新路径还没建好。

这是一个过渡期问题。它需要的不是哀叹,是设计——设计出能让年轻人承担真实后果的训练机制。

这是一个教育问题——当执行层被AI接走,年轻人从哪里获得真实试错的机会?这个问题,需要单独讨论。

这不是假设。

最近,一位匿名工程师在X上发帖,获得近800万次浏览。他入职一家大公司半个月,发现从规格、代码、测试到报告,几乎全由Claude Code 生成。管理层说“写代码不是瓶颈”,于是大家每天工作12到13小时,核心动作只剩一件事:和AI对话,然后按回车。

他说:“没人读任何东西。没人真正解决Bug。已经没人在思考了。”

马斯克回了一句:“Yikes.”

这正是旧路径断掉之后,一个值得警惕的场景:不是只有Lv5断代,而是所有级别的人,都可能被降格成AI的“人肉代理”。

没有责任绑定的“新路径”,不是训练,是围观。

围观再久,也长不出判断力。

打开网易新闻 查看精彩图片

七能力轴每天有新进展,责任链条跟上了吗?

能力轴:模型更强、成本更低、落地更快。进度条一天一个样。

责任链条:真值标尺、承重墙、换纸机制。责任链条的建设却明显没有同步。

资本按“通天塔能建成”定价,广告牌按“十年后建成”挂出去,预售证发到2036年。

能力轴天天发简报,责任链条几年没建房。

真正值得问的不是塔能不能继续往上盖,而是:主梁的工程图纸在哪里?

责任锚点有没有同样清晰的工程进度?谁在签字?谁在兜底?换纸机制在哪里?

不是不想回答,是真的还没有。

能力轴跑得越快,责任缺位越危险。车越快,越需要刹车。楼越高,越需要主梁。

打开网易新闻 查看精彩图片

八
AI能到几级?

先说清楚:这里有两个不同的问题,不能混在一起。

第一个问题:AI的判断能力,有没有上限?这是能力问题。答案是:不知道。也许有一天,AI的判断质量超过大多数资深工程师。也许不会。这条线,交给时间回答。

第二个问题:L5这个头衔,绑定了什么?这是制度问题。L5的定义里,包含“独立负责”。而“负责”,意味着决策权和责任必须形成闭环。责任最终必须落到一个可以被组织、法律和社会追责的主体身上。这个制度问题,和AI能力天花板在哪里,是两个独立的问题。

L3-L4:执行层。AI已经可以大量承担。

L5:责任分水岭。不是“能不能写出来”,而是“能不能在模糊条件下独立做决定并承担后果”。

L6以上:方向与组织。技术路线、资源配置、跨团队协调、长期技术债、商业目标。

能力可以无限提高,但职级不是能力的函数,而是能力×责任×制度的函数。

就算未来AI能够独立完成一个Linux内核级别的软件系统,只要“谁对这个决策的后果负责”这个法律和组织问题没解决,AI依然拿不到L5的头衔。

这不是能力问题,是职级定义问题。

我朋友的孩子在谷歌干了快八年,他说AI目前只能到Lv2-Lv3之间,Lv5似乎不可能实现。不是因为AI不行,是因为Lv5的定义里,本来就包含了责任。

打开网易新闻 查看精彩图片

九真正的危险不是AI替代人

AI到不了Lv5,不等于人就能一直待在Lv5。

因为Lv5是干出来的,而干的机会正在被AI接走。

真正的危险,是人自己放弃了判断力。

如果AI太顺手,人不再执行、不再犯错、不再承担后果——判断力的生产线就被掏空了。

到时候满街都是“知道分子”——知道很多,判断很少。

这里说的不是知识没用,而是知识越来越便宜之后,知识本身不再等于判断力。

知道分子是喂出来的,知识分子是炼出来的。

AI最擅长的,就是喂。

AI可以不断给你答案,但答案本身不能替你生产判断力。

这不是AI的错,是人的选择。而且它不需要AI失控。只要人开始习惯于不再自己判断,它就已经发生了。

打开网易新闻 查看精彩图片

十最后留下的,不是最会写代码的人

不是最会写代码的人。AI写得比你快。

不是最会调参的人。AI调得比你准。

是敢签字的人。

敢签字,不是盲目拍板。

敢签字,不是胆子大。是知道为什么签、知道什么情况下不能签,并且知道签错以后怎么负责。

敢签字意味着:能判断方向,能定义边界,能识别承重墙,能发现AI错在哪里,能在证据不足时拒绝上线,能在事故发生后承担后果,能在原有路径被证伪后重画路线。

这些能力,只能从真实执行、真实反馈、真实代价中长出来。

AI越强,这些能力越值钱。不是因为它们稀缺,而是因为在一个执行成本越来越低的世界里,真正稀缺的,恰恰是判断、验证和承担后果的能力。

AI时代,最值钱的能力,不是写代码,而是敢说:“我负责。”

AI可以替你写代码,却不能替你承担你签下的那个名字。

因为真正值钱的,从来不是签字这个动作,而是签字背后的判断力、验证力和责任。

最终落点

AI能不能写完代码,不是最终问题。

AI能不能做完工程,也不是最终问题。

真正的问题是:

谁来判断这个工程应该不应该做?

谁来判断它什么时候不能再做?

谁来判断原来的图纸已经错了?

谁来为这个判断签字?

而更深一层的问题是:

这个人,又是从哪里来的?

如果AI拿走了年轻人的执行、试错和承担后果的机会,却没有新的教育体系去生产判断力,那么最后消失的可能不是程序员,而是能够对复杂系统签字的人。

这不是AI的胜利,也不是人的胜利。

这是一个没人签字的系统的失败。

这三个问题连起来,指向同一个更深的命题:

当AI拿走执行层,人靠什么生产判断力?

往期发表

点击图片 ↓↓↓ 百篇一网打尽

请点击↓↓图片·美国故事连载持续更新1-9


100个国家·1000座城市

打开网易新闻 查看精彩图片

【带你深度游世界】

喜欢就点“赞吧↓↓↓↓↓↓↓↓