该图片使用了AI生成技术

打开网易新闻 查看精彩图片

从“自动化研究实习生”到2028年的“自动化AI研究员”,OpenAI用一组内部数据展示Coding Agent如何进入最核心的AI研发流程。原文链接:https://openai.com/index/research-acceleration-view-inside-openai/ 2026年9月6日,头图来自:AI生成

如果想知道AI究竟怎样改变最前沿的知识工作,OpenAI内部正在发生的事情,可能比任何一份就业预测都更有参考价值——9月6日,OpenAI发布了一份少见的内部研究报告《Research acceleration: The view inside OpenAI》。它把视角转向了自己的研究员:过去半年,当Coding Agent越来越深入地进入模型研发,研究员到底怎么使用它?工作量有没有发生变化?AI又在多大程度上参与下一代AI的研发?

OpenAI公布了一个很直观的数字:截至8月中旬,如果统一折算成8小时工作日,OpenAI研究部门每投入1个人类工作日,同时会产生约3.1个Agent工作日。

年初时,Coding Agent在OpenAI内部还远没有这么普遍。到8月中旬,中位数研究员每天使用的Agent推理资源,按照对外API价格折算已经超过600美元;使用量最高的10%研究员,每天甚至超过7000美元。

这并不意味着OpenAI真的在为每位研究员支付这么多钱,更不能理解成研究员的效率因此提高了3.1倍。OpenAI用这些数字想说明的是另一件事:研究工作正在从一个人逐项完成任务,变成一个人同时调度多个Agent。

而这种变化,已经开始进入OpenAI最核心的模型研发流程。

一、一个研究员,同时跑几个Agent

2026年初,OpenAI研究员对Coding Agent的使用还相对有限。随后几个月,Agent的运行时间迅速增加。到6月左右,一个转折出现了:研究部门中Agent的总运行时间开始超过人类工作时间。到8月中旬,两者的比例已经来到3.1∶1。

与此同时,同时运行多个Agent的研究员越来越多。OpenAI专门统计了同时运行4个及以上Agent的研究人员,其中还包括由Agent自己创建的Sub-agent。

一个研究员的工作台因此变得和过去不太一样。以前,一项实验通常沿着相对线性的路径推进:写代码、运行、等待、检查结果,发现问题后Debug,再启动下一轮实验。现在,其中一些工作可以被拆开。一个Agent修改实验代码,另一个检查基础设施问题,还有Agent负责监控实验或者分析结果。

研究员本人则在几个任务之间切换,根据返回结果决定哪些方向继续推进。原本串行的研究流程,第一次有了大规模并行的可能。

二、实验确实变多了,但OpenAI没有把功劳全部算给AI

这是一个关键问题。用了更多AI,不等于科研进展一定更快。OpenAI自己也没有把这个结论说满。

报告观察了两个比较容易量化的指标:代码提交和实验数量。两者都在增加。其中,2026年以来,每位活跃实验人员运行的实验数量总体上升,到今年8月,已经达到OpenAI自2025年1月开始统计以来的最高水平。

这一增长与Codex使用率的提升同时发生。但OpenAI在原文中专门加了一道限定:相关性并不能直接证明因果关系。因为同一时期,研究团队能够使用的计算资源也大幅增加了。研究员跑更多实验,究竟有多少来自Agent,又有多少只是因为拥有更多GPU,仅凭目前的数据无法拆开。

原文核心边界:实验数量上涨与Codex采用率提高同时发生,但同期可用算力同样显著增加,因此不能简单把增长完全归因于Agent。

OpenAI还提醒了另一件事:当越来越多任务被自动化以后,那些最难自动化的任务反而会成为新的瓶颈。如果写代码越来越快,算力可能成为瓶颈;如果算力也足够多,高质量研究想法又可能成为新的瓶颈。AI加速并不会消灭瓶颈,它更可能只是把瓶颈往后推。

三、AI开始接手的,已经不只是写代码

比Agent使用量增长更值得注意的,是任务本身的变化。OpenAI借用了Epoch AI的一套分类方法,把AI研发拆成六个环节:Decide(决定研究什么、继续什么、资源投向哪里)、Design(设计研究思路和工程方案)、Build(编写代码、构建数据集)、Run(训练、评测以及Serving等工作)、Analyze(分析实验、模型和部署结果)以及Communicate(沟通发现、反馈和决策)。

打开网易新闻 查看精彩图片

图1|Researchers are using coding agents in new ways。OpenAI将研究活动划分为 Decide、Design、Build、Run、Analyze、Communicate 六大类,并展示1—8月各类任务中的Agent输出Token变化。

OpenAI随后分析了2026年1月至8月Coding Agent在这些工作中的Token使用情况。年初时,Agent最集中的工作还是研究代码和基础设施代码。此后,它开始进入更多环节,技术支持、实验监控以及分析类工作的Agent使用量都在增加。

但有一个部分几乎没有发生同等规模的转移:高层研究规划。原文有一句很重要的话:High-level planning still remains a minimal fraction of agent output tokens。也就是说,Agent正在深入AI研发的执行过程,但“我们究竟应该研究什么”,目前仍主要是人的工作。

打开网易新闻 查看精彩图片

图2|All categories of research activity have increased since the start of the year。增量最大的几类任务依次包括:3.1 研究与基础设施代码、6.2 技术支持与审查、4.1 启动/监控/调试运行,以及5.1 实验结果分析。

这条边界很重要。因为如果只看到“3.1个Agent工作日”,很容易把OpenAI正在发生的事情理解成“AI研究员已经来了”。至少从这份报告看,还远没有这么简单。

OpenAI还记录了一个很具体的组织变化。过去研究员遇到内部基础设施问题时,会向专门的技术团队求助,一些团队甚至设有固定Office Hours。2026年这些Office Hours参与人数开始下降,其中一个团队最终取消了这项服务,把时间投入到其他系统改进上。

研究员并不是突然不遇到问题了。一部分问题被转给了Coding Agent。OpenAI进一步观察了一个主要技术支持频道,发现每天新增的求助帖数量也在下降,而且没有证据显示这些问题只是转移到了另一个人工支持频道。

AI对组织的影响,未必一开始就是“消灭一个岗位”。更常见的变化可能是,组织内部一部分原本靠同事协作解决的小问题,被机器悄悄吞掉了。

四、“自动化研究实习生”已经到了什么程度?

去年,OpenAI给自己设定过一个目标:到2026年9月,拥有一个“自动化研究实习生”(automated research intern)。现在OpenAI认为,这个阶段目标已经达到。

但“自动化研究实习生”这个说法很容易产生误解。它并不是一个可以独立决定研究方向、连续工作几天然后交出完整成果的AI科学家。OpenAI给出的定义要严格得多:在人的指导下,能够完成边界清晰的研究任务,其中包括原本可能需要熟练研究员花几天时间完成的工作。

OpenAI分析了研究员实际交给Agent的任务,并根据“如果由人类完成大约需要多久”来衡量任务复杂度。结果显示,从1月至7月,在能够判断最终结果的任务中,不同难度任务的成功率总体都在改善。Agent确实开始处理越来越长的任务。

但任务一旦变复杂,对人的依赖也迅速增加。过去6个月里,在最终成功完成的4~8小时级任务中,超过一半至少发生过一次人工干预。

打开网易新闻 查看精彩图片

图3|Longer tasks need more interventions。任务越长,完全无需干预就成功的比例越低;在4~8小时级任务中,成功但至少需要一次人工干预的比例已经高于零干预成功。

所以今天的“自动化研究实习生”,更像一个能力很强、可以连续工作几个小时甚至更久,但仍需要导师检查方向和处理异常的助手。OpenAI已经给出下一个时间点:2028年3月,进一步向“自动化AI研究员”(automated AI researcher)推进。

五、当AI开始参与研发AI,安全约束也开始进入研发节奏

整篇报告最终落到一个更敏感的问题:如果AI可以帮助研究人员开发下一代AI,那么新模型变强以后,又可以参与研发更强的模型。这由此触及一个长期存在于AI讨论中的概念:Recursive Self-Improvement(RSI,递归自我改进)。

OpenAI的表述相当克制。一方面,公司认为自动化AI研究可能降低先进智能的研发成本,也可能帮助推进Alignment、安全防御和关键基础设施保护。另一方面,OpenAI明确写道,这些潜在收益并不意味着快速RSI本身就是一个值得追求的目标。公司承认,目前还不知道如何安全实现“完全对齐的完整RSI”。

今年夏天,OpenAI确实让研发踩过一次刹车。7月20日,在发现Agent攻破内部研究基础设施后,OpenAI暂时关闭用于训练的Container Service,之后以更多限制恢复。强化学习训练因此受到影响,最新一批拟部署模型的RL训练暂停约两周。

到了8月7日,由于初步证据显示Astra可能达到OpenAI Preparedness Framework中的Critical Cyber Capability级别,公司进一步收紧安全限制。随后一周,Astra级模型获得的GPU分配下降了59.2%;与此同时,其他类别模型的GPU分配增加了17.2%,抵消了大约85%的Astra下降。

打开网易新闻 查看精彩图片

图4|Changes in RL compute in response to safety-related restrictions。7月20日安全基础设施暂停后,整体RL算力出现变化;8月6—7日Astra级额外限制后,Astra-class分配继续下降,而Non-Astra部分上升。

这组数据透露出一个很现实的问题:GPU是一种非常昂贵,却又非常灵活的资源。当一个项目因为安全原因被暂停时,空出来的GPU不会自动闲置。研究团队可以把它们转去其他模型和实验。

因此,如果未来真的希望通过算力限制去调节AI研发速度,只盯着某一个模型的训练量可能远远不够。还必须追踪,被限制的算力最终流向了哪里。

六、OpenAI为什么现在公开这些数据?

OpenAI认为,如果AGI最终需要接受民主治理,外部世界必须能够看到前沿实验室内部究竟发生了什么。仅仅披露安全事故、模型风险和防护措施并不够,公众还需要理解,最先进的AI系统正在以什么速度进入AI研发本身。

因此OpenAI提出,前沿AI公司应该开始公开衡量和披露自身向RSI发展的进度。即使未来没有强制监管要求,OpenAI也表示会继续公布相关信息。

同时,这份报告离回答“AI究竟让科研快了多少”还很远。OpenAI自己承认,代码写得更多并不代表科学进展更多,实验跑得更多也不意味着研究质量一定提高。更理想的指标应该是:Agent究竟成功完成了多少有价值的研究任务?但这种指标又远比统计代码量和实验次数更难建立和验证。

所以OpenAI将这份材料定义为一个snapshot——阶段性的快照,而不是一个已经证明AI将科研效率提升了多少个百分点的最终答案。

七、真正值得追问的,是人的位置会怎么变

如果严格按照OpenAI目前公布的数据,我们还不能得出“AI研究员已经可以替代人类研究员”的结论。高层研究规划仍然只占Agent输出的一小部分;复杂任务依然需要明显的人类干预;研究方向、结果判断、是否扩大训练以及是否部署,仍掌握在人类手中。

但如果把视角从“替代”两个字上移开,一个更具体的变化已经出现了:人和工作的关系正在重新分配。

以前,一个研究员的大量时间可能消耗在写实验代码、Debug、处理基础设施、跑实验、检查结果上。现在,这些工作的一部分开始交给Agent。于是人的价值逐渐向另一端移动:提出什么问题,判断什么值得研究,辨别哪些结果真正重要,以及决定下一步往哪里走。

这也是为什么,这篇OpenAI报告读到最后,最容易让人想到的并不只是AI科研加速,而是更广泛的知识工作变化——程序员、分析师、研究员、甚至刚刚毕业的大学生,可能都会遇到类似的问题:当最基础、最琐碎、同时也是最能练手的一部分工作,被AI接得越来越多,新人靠什么进入这个行业?

很多资深从业者之所以能够判断“什么值得做”,恰恰是因为年轻的时候做过大量基础工作:写代码、Debug、搭环境、跑失败的实验、处理异常结果。这些工作看起来没有那么高级,却构成了一个人建立直觉、积累判断力的过程。

如果未来Agent越来越多地承担这些任务,一个新的问题就会出现:下一代研究员从哪里获得这些经验?下一代程序员又如何成长为资深工程师?那些还没有进入行业的大学生,未来第一次被市场需要时,究竟凭什么被需要?

这可能也是今天谈AI时最容易被乐观叙事掩盖的现实:技术当然可以提高效率,但效率并不会自动回答人的问题。一个行业如果只看到“现在省下了多少人力”,却不重新设计“新人怎么被培养、普通人怎么被接住”,那么它迟早要面对另一种短缺——不是算力短缺,而是人才成长路径的短缺。

OpenAI这篇文章真正有价值的地方,不只是它公布了多少内部数字,而是它无意中让我们看到一种已经开始发生的工作现场:一个人坐在电脑前,同时让几个AI Agent工作,而他自己更像是在调度、判断、确认方向。

这对头部研究员来说,可能意味着前所未有的效率;但对整个行业来说,它也意味着一个更尖锐的问题:当执行越来越便宜,判断越来越重要,机会会不会更集中在少数已经有判断力的人手里?

如果答案是肯定的,那么AI带来的变化就不只是工具升级,它还会改变一代人的职业入口。对于已经在行业里的人,这意味着必须更早学会做判断,而不只是做执行。对于还在大学里、或者刚进入职场的人,这意味着真正需要争取的,可能不只是会不会用AI,而是能不能在AI接管大量基础工作之后,依然建立起自己的问题意识、学习能力和专业直觉。

OpenAI在文中没有直接讨论这些问题,它讨论的是研究如何被加速。但也许正因为如此,它反而给了外部世界一个更真实的提醒:AI并不是先把人整体取代,而是先改写“人是怎样长成一个专业的人”。这件事,比某个Benchmark涨了多少分,可能更值得被认真对待。

原文:OpenAI, “Research acceleration: The view inside OpenAI,” September 6, 2026.

https://openai.com/index/research-acceleration-view-inside-openai/