打开网易新闻 查看精彩图片

AI 离超越前沿科研人员还有多远?

近日,OpenRSI Index 在 X 上引发关注。截至目前,项目发布帖已有超过 13.3 万次浏览,相关话题出现在 X 的 Today’s News 栏目中。

打开网易新闻 查看精彩图片

图 1 OpenRSI-Index 出现在 X 的 Today’s News 栏目中。 X 发布帖:https://x.com/OpenRSI/status/2102831770458890626

随着大语言模型在部分评测基准上接近饱和,前沿科研人员面临一个越来越难以回避的问题:榜单上的进步,能在多大程度上转化为真实研究中的进展?

刷榜不等价于有效科研,而单纯跑通一个任务,更不等价于持续推进研究的能力。

从大规模数据预训练到人类反馈强化学习(RLHF),模型演进始终依赖有效的反馈信号。而当研究走向递归自我改进(RSI)时,一个关键瓶颈随之浮现:

当一个模型试图改进另一个模型,甚至尝试改进自身时,谁来为它定义真实有效的环境反馈?

这正是 OpenRSI Index 的出发点:科研智能体能否在明确的实验边界下,改进人类设计的模型训练方案,发现更好的方法?

打开网易新闻 查看精彩图片

  • Website: https://index.openrsi.foundation/index.html
  • GitHub: https://github.com/OpenRSI-Foundation/OpenRSI-Index
  • X: https://x.com/OpenRSI

如果智能体使用上千张 GPU,

会发生什么?

OpenRSI Index 从真实世界中有影响力的开源研究项目出题,将已有的模型、代码、数据和训练方案交给智能体,让它在这些成果之上继续改进。Marin、Qwen、GPIC 等项目因此成为科研智能体的考题,覆盖预训练、后训练与图像生成。

这些任务需要真正运行模型训练实验,算力投入也随之进入数千至上万 H100・小时的规模。官网展示的三个代表任务分别是:

  • 预训练:改进 Marin 的优化器。Marin-Scaling-Ladder 基于 Marin 开源基础模型研发项目,要求智能体将同一套优化器规则用于六档模型,覆盖 5.5 亿至 25.45 亿参数,检验一种方法能否在模型规模变化后继续有效。官网标注单次运行规模为 18,432 H100・小时。
  • 后训练:为 Qwen 设计更好的强化学习任务。Qwen-122B-RL-Merge 让智能体生成可验证的训练任务,改善 Qwen 模型在数学、代码等多个领域的表现。单次运行规模约为 20,864 H100・小时。
  • 视觉生成:从 GPIC 数据中学到更好的生成方法。智能体从共享模型检查点出发,探索架构、训练目标或训练方案的改进;每个候选方案对同一千万张图像最多再训练一遍。单次运行规模为 5,815 H100・小时。

三个任务放在一起,分别对应三个问题:方法能不能跨尺度成立?Agent 会不会根据反馈组织实验?一次改进能不能被清楚归因?

打开网易新闻 查看精彩图片

图 2|OpenRSI Index 的代表任务覆盖预训练、后训练与视觉生成,图中同时给出了各任务单次运行的 H100・小时规模。图片来源:OpenRSI Index 官网。

如果只看这些数字,OpenRSI Index 很容易被理解成:“只是把 Benchmark 做得更贵了。” 而它真正想改变的,其实不只是评测的算力规模,而是评测中所保留的现实复杂度。

为了获得稳定、可比较的结果,传统 Benchmark 往往会固定环境、缩小任务,把问题压缩成一个边界明确、答案清晰的测试题。这种设计当然有价值,但却和真实科研中的试错、尺度变化、有限预算和失败实验越来越远。

这些算力消耗在真实的训练和试验中。下图是 GPIC 文生图 任务公开的实验进展:智能体反复调整训练方案,并根据生成图像的评测结果继续改进。

打开网易新闻 查看精彩图片

图 3|GPIC 文生图任务的公开实验测量记录。横轴为研究耗时;纵轴 FD-DINOv2 衡量生成图像与参考图像的特征分布差异,越低越好。散点为各次测量,阶梯线为各智能体截至当时的最佳记录。图片来源:https://index.openrsi.foundation/tasks/gpic-leaderboard

任务也覆盖新兴开源研究。例如,Open-Jev 对应的 Kev 决策架构任务,让智能体改进直接输出决策概率的小模型,探索决策结构与训练方法。公开任务还涉及机器人、检索、推理与底层系统优化。

这些任务最终要回答的是:智能体能否改进人类设计的训练方案,发现更好的方法?

用独立的测试环境,

回应科研领域的 “猜疑链”

做过严谨实验的研究员都有过这种体会:测试分数上涨并非研究的终点。

  • 是否因为调参暗合了测试集的分布?
  • 是否巧合放大了微小的扰动?
  • 如果重新验收,这次改动还能否复现?

数据污染、测试关联性与不可复现的实验,是评估模型 “自我改进” 时无法绕开的问题。所以,一个关键原则就是:AI 的实验工作区与最终验收环境相互隔离。

在 OpenRSI Index 中,每一项任务都有清晰的资源与代码边界:哪些模块允许修改,可以调用多少资源,最终按照什么环境验收。

原作者发布的方案会在同一任务环境中重跑,作为对照。提交时,系统暂停工作区并保存快照,交由新启动的干净评测环境打分。私有测试不会交给执行研究的 AI,评测环境中的文件变化也不会带回工作区,但评分与规定的反馈会返回。如有篡改奖励路径、泄露评测信息、超出预算等硬性违规,则按规则计零分。

打开网易新闻 查看精彩图片

图 4 RSI-Harness 的工作区、独立验收与反馈流程。 项目原图:https://github.com/OpenRSI-Foundation/OpenRSI-Index/blob/main/assets/figures/rsi-harness.png

这套机制实际上包含两个循环。

内循环是研究循环: Agent 在持续存在的 workspace 中修改代码、运行实验,根据反馈继续研究。

外循环是验证循环: 每次正式提交都会冻结为 snapshot,再交给一个新启动的独立 Judge 重新验收。

在这套运行机制下,OpenRSI Index 并不要求 Agent “一次性给出正确答案”。它允许 Agent 反复试错。但每一次声称取得进步,都必须满足一个条件:不仅要在自己的实验记录里变好,还要在一个自己无法控制的环境中继续成立。

明确的约束与独立验收,为结果提供了可检查的基础。一次有效提交究竟能够说明什么,仍然取决于具体任务、预算和评价标准。但方法的可验证性和结果的可追溯性,让研究人员至少有了更具体的依据去回答:我引用的工作,本身是否真正可信?

强大的导师天团

OpenRSI Index 的导师阵容汇集了来自多个研究方向的学者。

打开网易新闻 查看精彩图片

图 5|OpenRSI Index 官网导师阵容,按姓名字母顺序排列。 图片来源:https://index.openrsi.foundation/

  • Luke Zettlemoyer|华盛顿大学。RoBERTa、BART 与 Toolformer 的共同作者,研究从语言模型预训练延伸到模型自主学习使用工具。
  • Karthik Narasimhan|普林斯顿大学。初代 GPT 论文的四位作者之一,也是 ReAct、SWE-bench 与 SWE-agent 的共同作者,研究横跨大模型、智能体方法与真实软件工程评测。
  • Yejin Choi|斯坦福大学。代表作包括常识推理基准 HellaSwag、常识知识库 ATOMIC 和知识生成模型 COMET,持续探索模型的常识理解与推理能力。
  • Dawn Song|加州大学伯克利分校。MMLU、MATH 等经典评测基准的共同作者,并参与 Agents’ Last Exam(ALE)、CyberGym 与 ExploitGym,将评测延伸到真实职业任务、漏洞复现和漏洞利用等复杂场景。

顾问阵容还包括 Wenhu Chen、Alvin Cheung、Jianfeng Gao、Pang Wei Koh、Ranjay Krishna、Hanqing Lu、Kunle Olukotun、Rameswar Panda、Radha Poovendran、Yu Su、Huan Sun、Diyi Yang、Ming-Hsuan Yang、Xiang Yue、Jian Zhang 和 Yu Zhang,覆盖语言、多模态、系统与安全等研究方向。

回归开源社区:

用你的代表作,为人工智能出一道题

团队相信,研究是一场正和博弈。通过开放共享研究方法、工具与实验基础设施,更多科研工作者能够检验、复用彼此的成果,并提出新的、有品味的问题。

正因为如此,OpenRSI Index 将任务、评测框架、验证工具与运行轨迹公开:

  • 有算力的团队,可以复用这套基准环境,检验已有结果,并继续探索新的研究问题。
  • 缺乏大型集群的小团队和个人研究者,可以看到 AI 改了什么、哪里失败、哪些方向尚未走通,把已有记录作为下一次尝试的起点。

一次失败不足以证明一个方向无法跑通;但完整的实验记录能帮助后来者判断哪些条件值得改变、哪些尝试值得继续,让品味引导试错,真正提升 AI 做科研的能力

“和智能体聊 1 小时 = 设计一个 RSI 任务”

那么下一个问题就是:谁来决定科研 Agent 应该研究什么?

OpenRSI Index 给出的答案是让真正做这些研究的人来出题。通过 RSI-Anything,研究者可以把自己开放研究工作逐步整理成 Agent 可以执行的研究任务。根据项目介绍,通过 RSI-Anything 与 AI 对话、确认关键设置,研究者可在约一小时内把自己的课题转化为可运行的 RSI 任务环境。AI 会自动整理提案、构建环境,帮助科研工作者为 OpenRSI-Index 贡献新的研究任务。后续实验与复现仍需相应的时间和算力;任务经审阅、复现并被接纳后,贡献者会获邀成为共同作者。

打开网易新闻 查看精彩图片

图 6|RSI-Anything 任务贡献流程。约一小时指前期对话与任务准备,后续实验时间随任务而异。项目原图:https://github.com/OpenRSI-Foundation/OpenRSI-Index/blob/main/assets/figures/rsi-anything-pipeline.png Website: https://index.openrsi.foundation/contribute

社区也在寻找算力伙伴,以及基础模型、生物医药、法律、3D 视觉、科学计算等领域的负责人和贡献者。让更多研究者把真正的问题带进来,让成功、失败和中间过程都可以被检查、复用和继续推进 —— 让 RSI 属于所有人,让 所有人参与 RSI 评价标准的建设,正是 OpenRSI Index 团队所强调的:From the community, for the community.