闻乐 发自 凹非寺
量子位 | 公众号 QbitAI

小扎去年撒出去的那些钱,好像终于开始听见响了……

Meta刚刚端出的新模型Muse Spark 1.3,已经和Fable 5掰上手腕了。

Artificial Analysis最新榜单里,Muse Spark 1.3 Max拿到62分。

跟Fable 5、5.1 xhigh打了个平手。

打开网易新闻 查看精彩图片

再往细项里扒,Coding和Agent这边Muse Spark 1.3已经开始在综合评分比自己高的Opus5 max面前冒头。

打开网易新闻 查看精彩图片

这事儿搁Meta身上,节目效果就不太一样了。

在Llama之后,Meta在顶流大模型赛道沉寂挺久,一度被对手甩开一大截。

就在不久前,小扎去年花重金攒起来的超级智能团队,还经历了余家辉离职的“变故”。

去年还在满硅谷挥着支票薅人,今年先跑了个核心研究员,这支高价攒出来的队伍,不会要高开低走吧?

正当大家继续围观这支天价团队后续剧情时——

新模型先上桌了。

Muse Spark 1.3:能肝,还贼便宜

Muse Spark 1.3:能肝,还贼便宜

9月2日,Meta正式发布Muse Spark 1.3

这是Muse Spark今年4月亮相之后,短短几个月里的第四个版本。

4月,初代Muse Spark;7月,1.1;8月,1.2;现在刚进9月,1.3又续上了。

小扎这次也亲自营业,称Muse Spark 1.3是目前整个系列在Coding和Agent工作上幅度最大的一次提升。

还放狠话,性能已经强到——

便宜得几乎都没必要算账了。

打开网易新闻 查看精彩图片

按自家给出的内部对比里,Muse Spark 1.3比1.2平均减少了约20%的工具调用和25%的Token消耗,同时会少浪费一些无效轮次,在长程任务里也更能记住一开始的要求。

网友也纷纷开始实测。

比如拿Muse Spark 1.3和1.2做一轮同Prompt对比。

一次性生成一个自包含HTML文件,在里面搓出三件可收藏的3D维京手办,维京头盔、镶钻战斧,以及一艘载着船员的长船。

成本差不多,一个0.08美元,一个0.1美元,但1.3做出来的细节质感明显高出一截。

打开网易新闻 查看精彩图片

还有网友直接把Muse Spark 1.3 Ultra Contributor和Fable 5.1 xHigh拉来折腾了差不多两个小时。

两边拿到同一个Prompt,但里面专门塞了一条相当折腾模型的规则:

每次完成之后,都交给独立Judge打分。不到9.5/10不准停,继续自己改。

然后Muse Spark 1.3真就没停……两小时里,它连续跑了20轮自我改进,每一轮又启动3个Agent,算下来就是一共60+次Agent运行。

而且全程花费不到1美元。

打开网易新闻 查看精彩图片

总结下来就是:真能肝,真能省

Muse Spark 1.3标准API价格仍然和1.2保持一致:

输入1.25美元/百万Token,输出4.25美元/百万Token,缓存输入0.15美元。

Artificial Analysis算下来,1.3 xhigh每个Intelligence Index任务的成本约0.55美元。

同一档附近的GPT-5.6 Sol Max和Grok 4.6 High分别约0.95美元和0.94美元。

而且,Muse Spark本身还只是Muse系列里更轻量的一条模型线,后面还有更大的模型。

小扎这次发完1.3,也没忘了继续预告两件事:

Muse Spark开放权重,即将到来。

以及那个已经吊了大家不知道多久胃口的:

曾经一度在前沿模型竞争里显得有点安静的Meta,又开始往桌子中央挤了。

Muse Spark这几个月突然加速的另一面,是小扎去年那场轰轰烈烈的抢人大战,也终于到了看成果的时候。

小扎去年薅来的那帮人,开始交作业了

小扎去年薅来的那帮人,开始交作业了

去年夏天,Meta组建超级智能实验室,小扎满硅谷挖牛人。

其中相当受关注的一批研究员,就是从OpenAI过去的赵晟佳、余家辉、任泓宇、毕树超等人。

各种天价package传闻满天飞,所有人都在吃瓜:

这支豪华班子究竟能搞出什么黑科技?

谁料黑科技还没来,剧情先拐了一下,余家辉宣布离开Meta创业。

一位核心研究员离开,自然让外界重新开始打量这支组建时间并不算长的明星团队。

不过现在再看,进度没落下。

而且新版本一出,几位核心研究员也纷纷出来爆料背后改动。

赵晟佳直接把Muse Spark 1.3称为目前Spark模型线里最强的Coding和Agent模型。

他特别提到了三个方向:

更长程的工作、更强的Agent任务能力,以及更可靠地遵循复杂指令。

打开网易新闻 查看精彩图片

毕树超披露的东西则更底层一点。

这次团队在训练阶段投入了更多算力做结果评分矫正

针对性解决模型偷懒划水、指令执行偏差、含糊回避作答,还有奖励投机、奖励黑客等问题。

经过这轮处理之后,模型的可用性有了非常明显的提升。

打开网易新闻 查看精彩图片

虽然Muse Spark 1.3挺猛,但小扎显然还没准备把牌一次打完。

那个已经预告不知道多少次、到现在还没切开的瓜,到底还能整出多大动静……蹲蹲蹲。

[1]https://x.com/finkd/status/2095232032896946311?s=20
[2]https://x.com/aimlapi/status/2095248072154701847?s=20
[3]https://x.com/SPAC89/status/2095284969614475744?s=20
[4]https://x.com/shengjia_zhao/status/2095233023247880590?s=20
[5]https://x.com/shuchaobi/status/2095234300199543121?s=20