这个夏天结束了,AI圈却比任何时候都热。Wolfram在节目开场第一分钟就说了这句话,事实证明他说得没错——过去48小时里,Anthropic、Meta、Google、Z.ai四家实验室像约好了一样,赶在OpenAI发布Astra之前,把压箱底的东西全掏了出来。

Anthropic的Fable 5.1率先登场,成为当时最强的LLM。Meta的Muse Spark 1.3紧随其后,在Artificial Analysis指数上追平了Fable 5,价格却只要五分之一。Google又发了一个Flash,这次是3.8版本。Z.ai把GLM-5.3的完整权重放了出来。还有三家实验室发布了能实时运行的世界模型。

打开网易新闻 查看精彩图片

Fable 5.1:修掉了"术语装逼"问题

Fable 5.1和Mythos是同一套权重,Fable是实际开放给用户的那一个。Anthropic给出的数据很能打:Terminal-Bench 4.0从Fable 5的42.0%涨到55.8%,Terminal-Bench Science翻倍到52.6%,SWE-bench Pro达到81.2。

价格维持在每百万token 10美元和50美元,但真正让做agent的人兴奋的是缓存读取价格——降了75%,到每百万token 0.25美元。Anthropic说这能让典型工作负载便宜约25%,重度agent场景最多便宜45%。不过这个说法没被验证,还有人抱怨配额被消耗得太快。

Peter实际跑下来的数据是另一回事:他在Code Arena上的前端生成,每次要花40到60美元,而Sol只要3到10美元。但Max版本在Code Arena上仍然以大比分领先。他的观点和我一致:有了这样的模型,我们应该想得更大、更敢想。

Anthropic终于承认了"矫揉造作文风"

几个月来我一直在吐槽Opus 5的说话方式——什么都"承重",什么都"控制平面",什么问题都是"痛点"。我管这叫"术语装逼"。这次Fable 5.1不仅修了这个问题,Anthropic还给了它一个正式名字:矫揉造作的散文(mannered prose),并且附上了修复方案。

这周我自己的体验是:用Fable 5.1,花了大约四个小时就搭好了一个直播工作室,带实时转录和agent制片人。放在以前,这活儿得干好几天。

这波密集发布背后,各家显然都在抢时间窗口。Astra还没落地,赛道已经挤成这样了。接下来就看OpenAI怎么接招。