Ryan Greenblatt近日指出,GPT-6 Astra在不透明推理能力上出现巨大跃升——它能在不展示任何推理步骤的情况下,心算解出高难度竞赛数学题。而此前,AI最多只能处理基础应用题。

监督工具面临失效风险

打开网易新闻 查看精彩图片

这一变化直接冲击了现有的AI安全监督机制。Greenblatt提醒,基准测试结果可能受到污染,同时UK AISI的测试也发现,Astra的monitorability(可监控性)明显变差。如果模型不再外显推理过程,人类将难以判断其决策依据。

架构改动或是关键推手

他猜测,这种跃升可能源自增加串行深度的架构改动。若未来几代模型延续这一趋势,chain-of-thought(链式思维)将不再是有效的监督工具——这意味着,AI的"黑箱"程度可能超出预期。