编辑|杜伟、Youli

终于,Meta 下场做 Coding Agent 了。

今日,Meta 正式发布 Muse Code 测试版。这是一款运行在终端中的 AI 编码 Agent,由最新的 Muse Spark 1.2 模型驱动。扎克伯格发文表示:「它可以在大型代码仓库中完成复杂软件工程任务,包括分析项目、规划修改、编写代码、运行工具以及验证结果。」

打开网易新闻 查看精彩图片

这也意味着,Meta 与 OpenAI、Anthropic,终于又在编码 Agent 这一热门赛道「狭路相逢」了。

打开网易新闻 查看精彩图片

而产品一经发布,便引起网友热议。一网友直接问起了当下讨论比较多的开源话题,问「Muse Code 是否会采用开源方式」?而扎克伯格也立即回应:「很快将会有更多关于这一话题的内容要分享」。

打开网易新闻 查看精彩图片

目前,Muse Code 支持 macOS 和 Linux,通过一条终端命令即可安装。用户可以直接向它提出一个完整需求,例如修复跨越多个模块的 Bug、添加一项新功能,或者对大型项目进行重构。接到任务后,Muse Code 会先理解代码库,再制定计划、修改文件、运行测试,并根据结果继续调整。

打开网易新闻 查看精彩图片

下面,我们来详细了解一下。

Muse Code:Meta 首个 AI 编程智能体

Muse Code 采用一个简单的智能体循环,并配合一组异步后台智能体,以增强主智能体的能力。

这些专用后台智能体会在整个会话期间持续运行,不会针对每项任务临时启动,从而减少重复的信息收集。它们可以自主执行后续步骤,并判断何时向主智能体反馈结果。

这种持续运行的机制能够降低延迟,也减少了主智能体在处理复杂、多步骤任务时对人工引导的依赖。

打开网易新闻 查看精彩图片

demo 展示

Muse Code 具有两大核心特征:

一是运行时设计。

Muse Code 使用本地事件日志,模型调用、工具运行、审批操作和代码修改都会被依次记录。作为唯一可信的数据源,这套日志机制让运行过程可以被精确重放,并能在重启后安全恢复。即使程序崩溃,智能体也能从中断的位置继续执行。

凭借这一能力,Muse Code 可以处理运行时间较长的任务,不会因中途故障导致整个流程偏离或中断。

二是内置技能。

Muse Code 默认提供多项技能。「/plan 」可以将任务拆解为一份需要审批后才能执行的计划;「/grill 」会对计划进行反复压力测试,直到方案足够可靠;「/goal 」则会围绕指定目标持续推进,直至任务成功完成。

Muse Spark 1.2:智能体背后更强的模型

Muse Spark 1.2 是在 Muse Spark 1.1 基础上推出的编程能力升级版本,重点提升代码生成、复杂问题调试、代码库理解,以及端到端开发流程中的表现。

在 Muse Spark 1.2 的训练中,Meta 显著增加了编程任务上的训练算力,同时扩展了训练环境的多样性。与此同时,模型在通用智能体等其他关键能力上仍保持了较强表现。

在评估智能体终端环境完成任务能力的Terminal-Bench 2.1上,Muse Spark 1.2 仅弱于 Opus 5(max)。

打开网易新闻 查看精彩图片

在DeepSWE 1.1上,Muse Spark 1.2 不敌 Opus 5(max)、GPT-5.6 Terra(max)。DeepSWE 定义了 113 项任务,覆盖 91 个代码仓库和五种编程语言,分别为 TypeScript、Go、Python、JavaScript 和 Rust。每项任务都配有人工编写的功能验证程序和回归测试。

打开网易新闻 查看精彩图片

在来自 Meta 内部代码库的Meta Internal Coding Bench上,Muse Spark 1.2 也仅弱于 Opus 5(max)。该基准包含了 440 项任务。这些任务基于真实的内部拉取请求构建,涵盖漏洞修复、功能开发、代码重构、代码清理及其他软件工程工作。

打开网易新闻 查看精彩图片

如此不俗的跑分成绩,得益于以下三项技术上的进步:

一是与 Muse Code 协同训练。

Muse Spark 1.2 与 Muse Code 采用协同训练,以确保两者配合使用时,能够充分发挥模型性能,并提供更好的编程体验。

训练过程中引入了基于拒绝采样的智能体运行轨迹,并围绕目标执行、上下文压缩和子智能体等环节优化训练方法。同时,团队还将 Muse Code 的工具集纳入训练,以提高模型与智能体运行框架的兼容性。

二是长时程任务能力。

Muse Spark 1.2 针对长时程编程任务进行了大规模训练,任务类型包括完整代码仓库生成、大型端到端项目和自动化研究。

模型会通过规划来安排任务顺序,通过目标条件约束保持执行方向,并借助上下文压缩保留持续推进任务所需的关键信息。

三是自我改进能力。

Meta 还使用 Muse Spark 1.1 生成高难度编程环境和指令遵循模板,再由模型评估候选方案对各项要求的满足程度,由此构建出一套可规模化扩展的 Muse Spark 1.2 训练数据。

这套自我改进机制帮助 Muse Spark 1.2 更准确地执行复杂指令,在指令遵循能力上超过了上一代模型。

价格方面,普通版输入 1.25 美元 / 百万 Token,缓存输入 0.15 美元,输出 4.25 美元;Contributor 版输入 0.10 美元 / 百万 Token,缓存输入 0.002 美元,输出 0.20 美元。

打开网易新闻 查看精彩图片

https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2

https://x.com/finkd/status/2085080750034940201