Fable 5以2726步的成绩在nanoGPT优化任务中大幅领先,Kimi K3跻身前三——但所有参赛模型都未能产出真正新颖的研究方法。这组看似矛盾的结果,来自Prime Intellect刚刚发布的迄今最大规模AI自主科研测试。 这项测试覆盖了18个主流AI模型,任务是让它们在nanoGPT优化这一经典课题上自主设计实验并迭代改进。每个模型都需要独立完成从提出假设、设计实验到分析结果的完整科研流程,整个过程没有任何人工干预。 从最终排名来看,Fable 5的表现令人瞩目。它以2726步的成绩断层领先其他参赛者,这一数字意味着它在实验效率和优化策略上具有明显优势。紧随其后的是Kimi K3,成功跻身前三甲。而DeepSeek的表现同样值得关注——据报道,该公司已提前启动相关实验室建设,显然对这一领域有着更长远的布局。 然而,成绩单背后有一个值得深思的发现:尽管Fable 5在步数上遥遥领先,但评审团队确认,没有任何一个模型真正提出了全新的研究方法。所有参赛方案本质上都是对已有技术的组合或优化,而非根本性的范式突破。 这一结果引发了关于AI科研能力的深层讨论。一方面,AI确实展现出了惊人的执行力——它们能够自主完成数百步的实验循环,并在效率上超越人类基线;另一方面,真正的创新——那种打破常规、提出前人未想过的思路——仍然是AI难以跨越的鸿沟。 有研究者指出,当前AI模型在科研场景中的表现更像“高效的工程师”而非“科学家”。它们擅长在已知空间内寻找最优解,却难以跳出框架去定义新问题。这种“优化有余、创新不足”的现状,恰恰勾勒出AI在科研领域的能力边界。 Prime Intellect表示,这项测试将持续更新,下一阶段将引入更具开放性的科研任务,以进一步检验模型在探索未知方向上的潜力。届时,是否会有模型实现真正的创新突破,值得期待。
热门跟贴