“GPT-5.6 Sol solved open problems in mathematics. So why was it struggling with ARC-AGI-3?”OpenAI官方账号在社交平台上的这句发问,揭开了一场关于AI评测的深层反思。当最强AI模型在一个看似简单的2D谜题测试中交出惨淡答卷时,问题很可能并不出在模型本身。

2026年6月底,OpenAI发布了GPT-5.6系列,其中的旗舰型号GPT-5.6 Sol被称为人工智能推理能力的又一次飞跃。它成功攻克了数学界悬而未决的“循环双重覆盖猜想”,并在没有任何人工干预的情况下完整通关了经典游戏《宝可梦 火红》。这种在复杂逻辑与长期策略上的惊艳表现,让人们很难把“不聪明”三个字和它联系在一起。

打开网易新闻 查看精彩图片

然而,当GPT-5.6 Sol被放进ARC-AGI-3这个专门衡量AI理解和适应新规则能力的基准测试时,结果却令人大跌眼镜——初始得分只有7.8%。ARC-AGI-3的设计思路很特别,它不给模型任何规则说明,只呈现一系列2D网格图案变换任务,要求模型通过试错和观察自行找出背后的规律,就像人类面对一个从未见过的新游戏时那样,边玩边学。

打开网易新闻 查看精彩图片

面对这个反常的低分,OpenAI的研发团队没有草率地下结论说“ARC-AGI-3对Sol太难了”,而是逆向追查整个评测管线。很快他们就发现,拖后腿的并不是模型解决问题的能力,而是测试框架——也就是所谓的Harness——在API调用和上下文管理上犯下了致命错误。

打开网易新闻 查看精彩图片

问题的核心可以拆解成两个技术细节。第一个和“推理消息”的处理有关。GPT-5.6系列在给出最终答复或调用工具之前,会先产生一系列内部推理消息,相当于在“心里”把问题先想一遍。在正常的对话中,这些推理内容会保存在会话历史里,方便模型在后续的交互中随时回溯和利用自己之前的思考过程。但在官方Harness中,这套机制完全失灵了。每次执行游戏动作之后,Harness都会把刚才产生的推理消息直接丢弃,同时随着上下文窗口逐渐塞满,更早的动作记录也被粗暴删除。结果就是GPT-5.6 Sol每做出一个新动作,都不得不从头重新推理