斯坦福大学研究人员牵头推出了一项名为 Terminal-Bench-Science 的基准测试,专门评估 AI 智能体在真实科研工作流中的表现。与以往由模型开发者或数据供应商设定标准不同,这次划定能力线的是科学家本人。
科学家自己出题
Terminal-Bench-Science 由 Terminal-Bench 原班团队打造,并与来自全球多个学科和研究机构的领域专家合作完成。测试内容不是教科书习题或标准化练习,而是从科研人员自己的研究工作中提取的、经过专家筛选的高难度工作流。
首版 Terminal-Bench-Science 0.1 包含 70 个任务,覆盖生命科学、物理科学、地球科学、数学和工程科学。这些任务要求智能体在真实环境中完成分析、模拟、证明、代码编写和数据产品生成,并通过可复现的专项测试进行评分。
最强模型只拿到30%
在 Terminal-Bench-Science 0.1 排行榜上,目前评估过的最强模型 Claude Opus 5 的解决率仅为 30%。这意味着即便是前沿 AI,距离成为真正有用的科研助手仍有明显差距。
研究团队的目标是推动具备科研能力的智能体发展,让它们承担技术性强、耗时高的工作,从而把科学家解放出来,专注于人类判断更关键的部分:定义研究问题、形成假设、解释和验证结果、交流发现。
持续更新,而不是发完就扔
团队指出,很多科学基准测试被当作论文发布后就停止维护,模型进步了,已知局限却一直留在那里。Terminal-Bench-Science 被设计成一个持续演进的基准,会随着前沿 AI 的发展不断更新,在科学需求和 AI 开发之间建立反馈循环。
研究团队强调,科学领域的容错空间很小,基准测试必须反映科学界的优先事项,而不是外部利益。通过让各领域科学家直接发声并共享平台,Terminal-Bench-Science 试图为 AI 在真实科研中的能力提供可验证的证据。
热门跟贴