GPT-6(内部代号Astra)发布在即,一份来自《The Information》的独家爆料,提前泄露了OpenAI最新的技术底牌。这一次的核心升级,是一套名为“循环深度”的架构级革新,它正在颠覆我们熟知的推理模式。

过去,大模型想解难题,会吐出一长串“思维链”;而“循环深度”直接让模型在内部的循环块里反复思考,然后给出最优解。这充分释放了模型的推理潜力,还节省了思维链中间文本带来的显存占用与带宽成本。

打开网易新闻 查看精彩图片

同时,这也带来新的安全问题。过去,“思维链”就像是AI的“心流日记”。虽然OpenAI的o1等模型已经隐藏了思维链,但那只是产品层面的“不可见”,后台数据依然有迹可循。这一次,OpenAI从架构层面把思维链“黑盒化”,连OpenAI首席科学家Jakub Pachocki都开始担忧,不希望因为《The Information》的报道,倒逼行业冲向“不可监控状态”的无序军备竞赛。

这还是一种深刻的“去文本化”的技术变革。对于AI而言,先将思考转化为线性、离散的人类语言文字,再重新解码识别的交流方式,其实是一种低效的“计算中介”。如今的大模型,正在试图抛弃人类语言,直接在“思想维度”里完成计算了。

当AI不再依赖输出文字来思考时,那座完全建立在“Token”计费之上的庞大AI商业帝国,根基开始松动了。

循环深度:当推理发生在“隐藏空间”

在切入循环深度这一技术话题时,一个值得关注的点是,为什么大模型既没增加参数,也没增加数据,仅仅在内部“多算了几轮”,性能就变强了呢?

传统Transformer的计算逻辑,像一条固定长度的单向流水线。从第一层开始输入Token,每生成一个新词,背后的算力都必须把所有物理层从头到尾地走一遍。这些层数是固定的,如果遇到简单的问题,走完所有层会造成算力的浪费。如果遇到难题,层数不够用,只能基于浅层理解“硬凑”答案。

为了弥补这一短板,行业想出了思维链(CoT)的办法,让模型把中间步骤写出来,再读回去接着算,相当于临时“加长”了思考深度。但本质上模型的层数没变,算力没有花在真正的“核心思考”上,又被浪费在生成、解析中间文字上。

而循环深度技术的核心逻辑是把核心运算层做成一个可循环的“转盘”,同一个数据可以反复经过同一组参数层,原地迭代打磨,直到推导充分了再输出。这样,“计算长度”变成了“计算深度”问题,算力的重心也从“生成思考过程”,花到了“真思考”上,其效率提升是十分惊人的。

早在2025年,学界有一篇论文《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》,亲自验证了这种思路的效果:一个仅35亿参数的小模型,通过内部循环32次,仅用相当于500亿参数模型的计算负载,在数理逻辑和代码任务上的表现就足以逼近甚至超越传统稠密大模型。

而且因为模型内部反复调用的都是同一套核心计算引擎,无论它在潜空间里把同一个数据反复运算多少遍,它都可以在同一块显卡内存空间里直接复用,让推理阶段的硬件显存开销成功实现了“封顶”。

与MoE深度融合:用时间换深度

这种技术正在和混合专家架构(MoE)走向深度融合,成为行业探索新方向:Recurrent MoE。

传统MoE里每个专家单次传播只激活一次,本质是“用空间换广度”;接入循环深度后,同一个向量每轮迭代都能重新路由到不同专家,同一个专家可以被反复调用打磨细节,变成“用时间换深度”,把参数的潜力榨到极致。

它不再用长篇大论的思维链(CoT)来凑字数,而是将所有的算力倾注在了看不见的纯逻辑推演中。这是全行业“去文本化”的一个缩影。大模型的核心思考,正在从人类看得懂的“文字空间”,彻底搬进了看不见的高维“向量空间”。

对大模型来说,把高维语义压缩成一串线性的文字,再重新解码成向量去计算,本身就是个充满信息损耗的低效路径。循环深度让所有逻辑推演、路径排查、方案验证,全部以数学形式在连续潜空间里完成,这远比语言符号更准确高效。

尽管循环深度还没在商业大模型里大规模落地,但业内纷纷展开探索,从OpenAI Astra的核心技术,到Meta内部探索的“连续思维链”,再到大厂关注的“椰子项目(COCONUT)”,都是这一套思路的延伸。

模型之间还要靠文字聊天吗

既然模型内部思考不用Token,那模型间的协作还需要文字沟通吗?今早在X上爆火的俄罗斯初创模型公司Mostik,正好给出了答案,用一种新的AI通信范式,把人类语言从操作系统降级为显示驱动。

在传统的多模型协作中,模型与模型之间的沟通如下,模型A算出了答案,先翻译成人类语言,然后模型B再破解这些语言,读取Token。这种方式较为低效,成本也高。

Mostik直接取消了“文本中转”这一环,为模型间搭了一座“桥”,而这座桥可以理解为“机器心灵感应”。具体而言,他们训练了一个轻量的桥接矩阵,把大模型理解问题后的高维隐状态,直接投影进小模型的输入潜空间。整个过程不生成任何一个Token,两个原模型的权重也完全不用微调,信息在纯向量层面上畅通无阻。

这种思考来自一种数学的思维,其创始人Sasha Malysheva带领一众数学博士,联手2010年菲尔兹奖得主Stanislav Smirnov,发现不同模型的潜空间,存在天然共通的语义流形。

虽然对齐全量权重是艰难的事情,但为模型间搭一座小桥,却足以让语义互通。而且这种方式是一种高精度的完整还原,不改动任何一个原模型的权重。这让它体积极小、训练成本极低。

在实验中,他们尝试把GLM-5.2(753B)和Qwen-3.5(4B)搭了一个桥,昂贵的云端大模型在关键难题上动脑后,然后把产出结果传给端侧小模型执行。结果混合系统的推理成本仅为GLM-5.2的二十分之一,跑出了相当于顶级模型近80%的准确率。在极其严苛的ARC-AGI排行榜上,这个“拼凑”的轻量化方案一举斩获了第一名,得分远超预期。