OpenAI把一份数学研究的"底稿"摊开了:722篇全手稿及目录正式发布。这批材料不是零散笔记,而是一套完整的推理过程记录,平均每项任务耗时3小时。
3小时意味着什么?它指向一种不同于以往的工作方式——长时间深度搜索与策略回溯,取代了传统极短字元预测。推理时间的长窗口运用,正在成为科学探索、代码生成与数理验证的关键路径。
从4000到372的筛选逻辑
这批结果的产生并非一蹴而就。OpenAI对大约4000个复杂研究问题运行推理,再进行高标准的聚类归并,最终筛选、输出372个具备重大科学贡献的结果支系。
从4000到372,中间隔着的是一道聚类归并的关卡。不是所有跑通的问题都能留下,只有经过归并后仍站得住的结果支系才被保留。这套流程本身,就是长窗口思维思考机制的一次集中展示。
长窗口推理的样本价值
722篇手稿加目录,配上372个结果支系,构成了一份可追溯的推理档案。它记录的不只是答案,还有达成答案的路径——深度搜索怎么走、策略回溯在哪些节点发生。
对关注大模型能力边界的人来说,这份材料的价值在于它把"思考时间"变成了可观察的对象。推理耗时从秒级拉到小时级,模型在数学这类需要密集逻辑算力的场景里,展现出的是一种新的工作节奏。
热门跟贴