给一个智能体一整年时间,让它做一连串相互关联的决策,中间有延迟反馈,还要承担自己过去行为带来的后果——它的表现会相对人类直接崩掉。这是Rohan Paul在X上分享的一篇论文给出的结论,他称之为对长周期AI的一次"残酷现实检验"。

研究测试了八款领先模型,其中包括GPT-5.6 Sol和Claude Opus 4.8。但表现最好的组合——Qwen3.7-Max搭配Hermes——最终赚到的钱,只有人类参与者平均水平的27.3%。

打开网易新闻 查看精彩图片

Rohan Paul的评论很直接:一个系统完成一年期任务时只有人类四分之一的表现,离可靠的长周期执行还差得远。

八款模型,一个共同的天花板

这项评测的名字叫MerchantBench。它把模型放进一个需要长期经营、连续决策的环境里,而不是让它们做一次性的问答或短任务。测试对象覆盖了当前第一梯队的多个模型,GPT-5.6 Sol和Claude Opus 4.8都在名单里。

结果没有出现"某款模型遥遥领先"的剧情。即便是最优配置,最终收益也只有人类平均水平的27.3%。这个数字意味着,在需要跨时间维度权衡取舍的场景里,模型距离"能用"还有明显距离。

Rohan Paul把问题指向了长周期任务本身的特性:相互关联的决策、延迟的反馈、以及过去行为带来的后果。这三样东西叠加在一起,模型的性能就撑不住了。

Chamath的炮轰:长周期任务就是个笑话

这条讨论下面,Chamath在斯坦福的一段话被翻了出来,措辞相当不客气。

他说,长周期任务仍然是个笑话,它们根本不管用,他不在乎别人怎么说。不要拿一个愚蠢的评测给他看,也不要跟他讲什么跑了48小时的脚本。长周期任务没有被处理好,它们就是不管用。

这段话的情绪和论文的数据指向了同一个方向:在长周期、多步骤、有后果的任务上,当前的大模型还远没有达到可依赖的程度。

27.3%这个数字该怎么读

27.3%不是一个抽象的分数,它对应的是真金白银的收益差距。在一个模拟长期经营的评测里,最好的模型组合赚到的钱不到人类平均水平的三分之一。

换句话说,如果把一个需要持续一年做判断的任务交给当前最强的模型配置,产出大约只有人类参与者的四分之一多一点。这个差距不是靠换个提示词或者多跑几轮就能抹平的。

Rohan Paul的总结是:这样的系统离可靠的长周期执行还差得远。他没有给出乐观的预期,只是把数据摆了出来。

长周期为什么这么难

短任务里,模型只需要在有限上下文里给出一个正确答案。长周期任务不一样,它要求模型记住自己之前做过什么,理解这些动作如何影响后续局面,还要在反馈延迟的情况下继续做判断。

MerchantBench的设计正好压在这几个点上。相互关联的决策意味着每一步都会改变后面的选项;延迟反馈意味着模型不能立刻知道自己做对了还是做错了;自己过去行为的后果意味着错误会累积。

八款模型在这个环境里的表现,说明当前的技术路线在处理这类问题时还有结构性短板。Rohan Paul的措辞是"性能相对人类崩塌",Chamath的措辞是"根本不管用",两个人用的词不同,指向的问题是一样的。

对于关注智能体落地的人来说,这份评测提供了一个具体的参照:在需要跨越长时间维度、承担决策后果的场景里,把任务完全交给模型,目前还不是一个可靠的选择。