编辑|Panda

今天凌晨,OpenAI 免费了 GPT-5.6 Luna。几乎在同一时间段,另一家曾经打造出 Llama 系列、随后在大模型竞赛中一度掉队的公司也发了声——Meta 在 上宣布,它把自家 AI 模型送进了五项 STEM 学科奥林匹克竞赛,全部拿到金牌或金牌水平成绩,其中两项物理竞赛的理论考试直接满分。

打开网易新闻 查看精彩图片

更惊人的是,Meta 表示,其 AI 是纯靠推理能力取得的这些成绩:「我们禁止了所有工具的使用,这意味着没有搜索、没有编码,也没有计算器。」

对此,曾在 OpenAI、DeepMind、谷歌大脑工作过的 Meta 研究者 Lucas Beyer 还在 上揶揄了 Gary Marcus 和 Yann LeCun。不过,这两位长期批评自回归 LLM 的著名研究者并未直接答复。

打开网易新闻 查看精彩图片

看起来,Meta 似乎又重新支棱起来了?

不过,Meta 目前尚未发布相关技术博客或研究报告,但参与了该项目的 Meta 研究者 Shuchao Bi 也发了两条推文,补充了更多细节,包括该模型是是来自 Muse Spark 系列的内部训练版本,使用了多智能体编排与并行推理

打开网易新闻 查看精彩图片

不仅如此,Meta 的模型还答对了官方答案错误的问题。Shuchao Bi 说:「这一发现最终防止了人类参赛者的答卷被错误评分。IPhO 委员会好心地向我们寄送了一枚实体金牌。」

打开网易新闻 查看精彩图片

成绩单

Meta 列出的五项成绩是:亚洲物理奥林匹克竞赛(APhO)理论考试满分,国际物理奥林匹克竞赛(IPhO)理论考试满分,国际数学奥林匹克竞赛(IMO)金牌,国际化学奥林匹克竞赛(IChO)金牌水平表现,以及罗马尼亚数学大师赛(RMM)金牌水平表现。

先说这几项赛事的分量。IMO 2026 年第 67 届在上海举行,百余国选手用两场各 4.5 小时的考试解六道题,满分 42 分。RMM 每年 2 月在布加勒斯特举行,只邀请十几支最强国家队,题目难度公认不亚于 IMO。IPhO 与 APhO 分别是全球和亚洲规格最高的中学物理竞赛。

成绩上,两项物理写的是「满分」,IMO 写的是「金牌」,IChO 和 RMM 写的却是「金牌水平的表现」。后一种措辞在这个领域通常意味着成绩未经赛事组委会正式评定,而是按当年金牌分数线自行对照得出的结果。

Meta 同时表示,感谢这些竞赛的选手与组委会「对我们参赛的支持」,这暗示至少部分赛事的参与经过了组委会层面的协调——这一点比 2025 年 OpenAI 找三位前 IMO 奖牌得主自行评分的做法要正式一些。

纯推理:禁用一切工具

Meta 特意强调,为了测试纯粹的推理能力,模型被禁用了所有工具:不能搜索,不能写代码,不能用计算器。

这个约束很重要。过去一年里,奥赛榜单上不少顶尖成绩其实是靠「强模型 + 验证器 + 多轮精修」的 agent 流水线拿到的。有研究者用 Gemini 3.1 Pro 搭了一个结构相当简单的 agent,在 IPhO 2025 理论题上跑五次、五次满分;但作者自己也提示,该模型发布晚于竞赛,数据污染无法排除。

打开网易新闻 查看精彩图片

https://arxiv.org/pdf/2603.03352

Meta 把工具全部关掉,等于主动放弃了这条最容易刷分的路径。

不过物理竞赛还有一层没被提及:IPhO 和 APhO 都包含实验考试,Meta 报告的应该仅是理论部分。

从 Llama 到 Muse

2025 年是 Meta AI 最难熬的一年。Llama 4 Maverick 在 Artificial Analysis 智能指数上只拿到 18 分,Behemoth 因内部对能力不满而推迟,扎克伯格随后亲自下场重组,斥巨资引入 Alexandr Wang 与 Scale AI 团队成立 Meta Superintelligence Labs(MSL),把预训练架构、数据管线和 RL 后训练系统整个推倒重建。

2026 年 4 月 8 日,MSL 交出第一款模型 Muse Spark,原生多模态、262k 上下文,智能指数从 18 跳到 52。7 月 9 日 Muse Spark 1.1 上线,主打 agentic 与编程,也是 Meta 第一个收费 API 模型。

就在本周,基于 Muse Spark 1.2 的终端编程智能体 Muse Code 进入 beta,据说能力相当出色。

打开网易新闻 查看精彩图片

按这个节奏看,这份奥赛成绩单更像是下一代 Muse 模型的预告片。

Meta 支棱起来了吗?

这是最值得追问的地方。2025 年 7 月,OpenAI 与 Google DeepMind 双双拿下 IMO 金牌(35/42,六题解出五题)时,OpenAI 研究员把它称作行业的「登月时刻」。一年过去,坐标系已经完全变了。

2026 年 7 月的上海 IMO 结束后,华为的 Celia 与小红书的 dots-note-3.0 先后宣布拿到 42/42 满分,小红书称此前从未有大模型在 IMO 官方评审流程下拿到满分。参阅机器之心报道《AI 首次拿下 IMO 官方满分金牌,背后藏着一套自我纠错机制》。

此外也有报告称 Anthropic 的 Claude Opus 5 在不使用 agent 框架和工具的条件下一次通过全部六题,四份独立解答全部正确。

换句话说,在 IMO 这一项上,Meta 的「金牌」放进 2026 年的排位里并不格外显眼。真正有分量的反而是两项物理理论满分——前提是这些成绩能被独立验证。

更值得警惕的是,奥赛作为推理能力标尺正在以肉眼可见的速度失效。Meta 给出的理由是「为了理解我们在推理上是否取得了真正的进展」,但当同一批竞赛在一年之内从「难以企及」变成「多家实验室都能刷满」,这把尺子能提供的信息量正在急剧衰减。

数学界早有提醒:陶哲轩在 2025 年就指出,AI 能做到什么很大程度上取决于测试方法本身。奥赛题有标准答案、有明确评分标准、有充足历史题库可供训练,这些恰恰是现实科研问题不具备的条件。

打开网易新闻 查看精彩图片

那么,Meta 支棱起来了吗?从 Muse Spark 到 Muse Code 再到这份成绩单,它至少不再是那个只能靠开源叙事维持存在感的公司。但要说重回第一梯队,还需要拿出更多的东西,尤其是一个真正能被用起来的产品。

https://x.com/prz_chojecki/status/2085444920983298494

https://x.com/AIatMeta/status/2085388945148297322

https://x.com/shuchaobi/status/2085386404805374100