人工智能行业砸下超过1.6万亿美元,结果呢?一项来自加州大学伯克利分校的最新研究戳破了泡沫——目前所有号称“前沿”的AI工具,在真实职场任务里依然是一塌糊涂。别管厂商怎么画饼,数据不会骗人:GPT-5.5最高只拿下24%的通过率,而所有顶级模型在最难那一档任务里,齐齐交出零分答卷。这场被戏称为“智能体期末考”的测试,让整个行业在“AI革命即将到来”的豪言壮语面前狠狠跌了一跤。

研究团队来自伯克利“负责任去中心化智能中心”(Center for Responsible, Decentralized Intelligence),他们设计了一套叫“Agents’ Last Exam”(ALE)的严苛评估基准,名字正是对知名测试“Humanity’s Last Exam”的调皮回应。ALE总共覆盖了55个职业、超过1500项由专家提供的任务,目的是系统性地检验当前最先进AI模型的“上岗能力”。

打开网易新闻 查看精彩图片

受测的模型名单,基本就是当下AI军备竞赛的明星阵容:OpenAI的GPT-5.5、Anthropic的Fable 5、Cursor的Composer 2.5、Google的Gemini 3.1 Pro,以及两个来自中国开发者的开源模型。它们无一例外,全部在ALE面前栽了跟头。

先来看总成绩。GPT-5.5是表现最好的一个,整体通过率也只有24%。也就是说,即使是最能打的AI,面对1500多项专业任务时,仍有接近八成的工作做不到合格。研究人员在报告中写道:“今天的智能体可以解决一小部分专业任务,但当我们看向那些需要持续推理、深厚领域知识以及长时间稳定执行的高难度任务时,它们距离人类水平还差得远。”

更扎心的数据还在后面。随着任务复杂度的提升,分数几乎是跳崖式崩塌。在ALE设定的最高难度层级上,所有参测模型——包括Anthropic倾力打造的Fable 5——成功率全部为零。一个能打的都没有,集体交了白卷。这意味着,一旦进入需要真正落地、不能靠概率蒙对的深水区,当前的前沿AI连门槛都摸不到。

不止是能力不行,账也算不过来。研究人员专门对比了成本:Fable 5的性能与GPT-5.5和Composer 2.5差不多,但完成每项任务的费用却是后两者的4到12倍。花最多的钱,拿一样烂的分数,巨大的性价比缺口让“前沿”二字显得格外讽刺。

这次测试覆盖的职业范围远比常见的AI暴露清单更广。除了人们谈论最多的软件工程、图形设计,ALE还纳入了海事工程、农业、音频制作、公共卫生操作等大量“AI到底行不行”尚不明朗的领域。换句话说,研究不只盯着那些已被炒作过的白领岗位,也把镜头对准了各行各业的真实工作流。结果就是,没有一块遮羞布能留下。

产业界一直在说,未来几年AI的能力会以指数级跃升,释放出前所未有的经济增长。但伯克利这份报告用冷冰冰的基准成绩提醒所有人:故事讲得再好,考试不及格就是不及格。技术可以进步,预期可以拉满,但在现实世界的工作桌前,今天的AI连个及格用的板凳都还没坐热。如果24%的通过率和最难任务零成功就是“革命前夜”的答卷,那么这场革命,显然还要再等上很久。