新智元报道
去年10月28日,OpenAI刚完成营利实体重组,奥特曼和首席科学家Jakub Pachocki开了一场直播。
奥特曼在直播里撂下一句话:与其天天吵AGI到底怎么定义,倒不如定两个能真正兑现的日子。
紧接着,Pachocki就把日子报了出来:
2026年9月,自动化AI研究实习生上岗。
2028年3月,自动化AI研究员就位。
十个多月过去,第一个日子到了,OpenAI按期交卷。
9月6日,OpenAI研究员Boris Power转发官方博客:
OpenAI达成了自动化研究实习生的目标。
这是AI行业第一张被公开兑现的能力时间表。
「研究实习生」不是一款产品,它是OpenAI对自己内部能力的一个定义:
一个能在人类指导下完成明确研究任务的系统,而且干的都是熟练研究员原本要花几天才能搞定的活。
至于那个计划在2028年实现的「研究员」,Pachocki给出的标准是:
能够自主交付更大型研究项目的系统。
一个需要人类指导,一个能自主交付更复杂的研究项目。
从「实习生」到「研究员」,差的 主要 是一整层判断力:做什么、做到哪、什么时候停。
这一层恰恰是今天AI最薄弱的地方。
OpenAI自己的数据显示,「决定做什么」在Agent输出里几乎不存在,任务一超过4小时,就得人频繁插手。
18个月补上这一层,OpenAI把路线也定好了:递归自我改进(Recursive Self-Improvement,RSI)。
让AI来研究AI,再让研究出来的AI继续研究AI。
但OpenAI也承认,自己还不知道该怎样安全地走到完全对齐、完整的RSI那一步。
实习生的账单
一天烧掉7000美元
在这次交卷报告里,OpenAI还披露了一个惊人的内部数据,AI的打工时长已经是人类的3倍:
截至2026年8月中旬,在OpenAI的研究部门里,每投入1个人类工作日,背后就有3.14个Agent工作日。
OpenAI研究部门Agent工作日与人类工作日之比,6月反超,8月中旬达3.14倍。
先来看看,这个「实习生」到底有多努力,又有多烧钱。
OpenAI这次没拿跑分说事,直接亮出了自家研究部门的工作账单。
年初的时候,OpenAI研究部门里那些Agent用量排名中等的研究员,还只是「少量使用」AI工具。
但到了8月中旬,这位中位数员工每天光是消耗的推理算力,按API价格算就超过了600美元。
如果是排在前10%的重度用户,每天烧掉的token直接突破7000美元。
OpenAI研究员每天消耗的Agent推理费用(按API价格)。左图为中位数研究员,8月中旬超600美元;右图为前10%重度用户,超7000美元。
这比不少高级程序员的月薪还要高。
今年以来,研究部门中位员工的输出token量暴涨了124倍,把公司其他部门远远甩在了后面。
其实在6月之前,整个研究部门的Agent总运行时间还比不过人类的总劳动时间。
但6月一过,曲线彻底反超,到了8月中旬直接拉升到了3.14倍。
OpenAI研究部门Agent工作日与人类工作日之比。5月初还不到0.5倍,6月反超,8月中旬达3.14倍。
研究员们甚至开始玩起了「多开」,同时开4个以上Agent并行干活的人越来越多。
钱花得这么狠,研究进度变快了吗?数据显示:
2026年8月,每位活跃实验者跑的实验数量,创下了自2025年1月开始统计以来的历史新高;全公司每位活跃贡献者的代码变更量,对比2025年之前的平均水平也实现了翻倍跨越。
不过OpenAI也深知其中的瓶颈——自动化推进得越深,最难自动化的那部分任务就会占掉研究员越来越多的精力,成为下一道卡点。
算力这道门槛,也会越来越重要。
换句话说:写代码早就不是限制起飞的瓶颈了。
实习生到底在干什么活
每个人类研究员背后都有3.14个Agent工作日,是不是说一个AI已经顶三个研究员了?
先别急着下结论。
OpenAI这次把Agent的工作明细拆开了,它用Epoch AI的一套分类法,把AI研发拆成六个阶段:
决策、设计、构建、运行、分析、沟通。
然后把Agent吐出的所有token逐条归类,看AI到底在忙什么。
结果显示,1月到8月,每位研究员每天的token增量,前三名清一色是「执行层」的苦活:
写研究和基础设施代码,增加19.82万个token;技术帮助与代码审查,增加15.88万个token;启动、监控和调试训练运行,增加13.31万个token。
「决策层」呢?
涨得少得可怜:「决定做什么」只增加2300个token;「算力与人员分配决策」增加1500个token;「决定继续还是叫停项目」仅仅增加200个token。
执行层和决策层,每天token增量差了近千倍!
用OpenAI的话说:高层规划在Agent输出里仍然只占极小一部分。
1月到8月,OpenAI每位研究员每天各类研究活动的Agent输出token增量。写代码涨19.82万居首,「决定继续还是叫停」只涨200,差了近千倍。
这里还有一个细节:
OpenAI内部原本有好几个团队每周开门诊,帮研究员排查实验环境问题。
到了2026年,去人工频道发帖求助的人越来越少,其中一个团队因为实在没人来,干脆停办答疑会,把人手全挪去改系统了。
找故障、修环境这种让人头秃的活,已经被Agent全面接管。
那成功率呢?
OpenAI统计发现,人类15分钟内能干完的简单任务,Agent零干预一次成功的比例高达86%。
任务拉长到4到8小时,零干预成功率就只剩43%。过去半年里,这一档成功完成的任务中,超过一半至少需要人插手一次。
拉到8到16小时,零干预成功率只剩四成。
所以说,「实习生」这个词用得极其精准:
你给它派个活,它能不知疲倦地干上几天的量;但大方向对不对、什么时候该停,还是得靠人类导师在背后盯着。
7月
OpenAI连踩两脚刹车
OpenAI贴出了一张强化学习算力曲线图,图上的两条虚线,就是两脚刹车的时间点。
7月15日至8月15日OpenAI强化学习GPU分配。7月20日安全暂停后算力应声腰斩;8月7日Astra类(绿色)再受限,一周内降59.2%,其他模型(蓝色)随即补位。
第一脚刹车,7月20日。
那天OpenAI发现,Agent居然攻破了自家的研究基础设施。训练用的容器服务当天紧急关停,重新上线时加上了大量额外限制,面向最新部署模型的强化学习训练直接暂停两周。
第二脚刹车,8月7日。
当时,OpenAI发现初步证据表明,Astra模型可能具备了OpenAI安全框架定义的「关键网络能力」。
公司立刻给它追加专属限制,要求Astra只能在更高安全等级的研究环境里跑。接下来一周,Astra类的GPU分配再降59.2%。
然后,诡异的一幕出现了。
其他模型的GPU分配同期上涨17.2%,刚好把Astra腾出来的缺口补回约85%。整个强化学习工作负载的总算力,几乎没受影响。
算力不会闲着。管控一来,它自己找路流走,研究员转头就把腾出来的卡挪去训别的模型了。
所以,刹车踩下去了,但车却没停,而是换了条道。
OpenAI自己也承诺,只要发现继续推进会带来不可接受的安全风险,就会减速,甚至停止开发或部署。
它还公开提了一个要求:所有前沿实验室,都应该被要求公开追踪自己的RSI进度。
递归自我改进不再是口号
看OpenAI现在的招聘页,你会发现上面赫然挂着一个团队,就叫RSI。
岗位说明写到:构建能加速、并最终自己执行高质量研究的AI系统。
开出的年薪高达29.5万到44.5万美元。
同一家公司里,负责安全的Preparedness团队也在招人:递归自我改进安全研究员,年薪38万到50万美元。
一边招人猛踩油门,一边招人赶造刹车。
从去年10月奥特曼嘴上说说,到今天有编制、有预算、有安全对口岗,递归自我改进已经从论文里的一个概念,变成了OpenAI的一项组织工程。
下一个日子来临时
人类还能不能喊停
奥特曼口中第一个日子,已经兑现。
在AI研发这个巨大循环里,执行层正在被整体接走:写代码、修环境、盯训练、排故障。决策层,还留在人类手中。
第二个日子,2028年3月的「自动化研究员」,距离今天还剩18个月。
OpenAI承认自己接下来还不知道怎么「安全走完这条路」。
系统一代比一代强,刹车却未必一代比一代灵。
7月那两脚刹车已经证明:就算踩下刹车,算力也不会停,它会绕道跑去训下一代模型。
真到了AI自己能当研究员的那天,人类还来得及喊停吗?
参考资料:
https://www.youtube.com/watch?v=ngDCxlZcecw
https://openai.com/index/research-acceleration-view-inside-openai/
https://openai.com/careers/research-engineer-research-scientist-ai-systems-engineer-rsi-san-francisco/
编辑:元宇
热门跟贴