打开网易新闻 查看精彩图片

文章转载于量子位

作者:程浅

Anthropic前脚刚发布了Fable 5.1(具体可见),后脚第三方权威跑分和个人第一手实测已经出炉了!

Anthropic研究员就展示了用Fable 5.1写代码,直接生成设计视频:

看看这效果,谁不想急头白脸地用一顿……

打开网易新闻 查看精彩图片

话不多说了,咱们先上实测。

1

网友上手花样实测

看实例之前,先来看ARC Prize的基准测试。

成绩很不错,ARC-AGI-2拿下90.0%,ARC-AGI-1干到97.5%。

成本也更低,ARC-AGI-2每任务$3.12,ARC-AGI-1每任务$1.40,比Fable 5直接砍了32%

打开网易新闻 查看精彩图片

正经跑分之外,大量网友没忍住火速开玩,给大家看看网友们的作品——

最火的是一款马里奥风格的赛车游戏。

据说只有一句提示词——

「用CryptoNinja的MCP来制作一款马里奥卡丁车风格的游戏

然后,嘎巴一声就做出来了,如下:

打开网易新闻 查看精彩图片

无独有偶,另一款“仅用一张截图”就做出来的赛车游戏,长这样:

打开网易新闻 查看精彩图片

对此,有热心网友发来「悲报」

马里奥赛车完蛋了啊。

此外,还有网友同样用一条prompt做出了一款恐龙主题的生存游戏。

包含20多个小时的可玩内容,涉及烹饪、制作道具、狩猎和驯服恐龙等玩法,还支持多人联机。

我觉得有必要放视频给大家感受一下效果。

他只用几个小时就做出来了,最后和朋友骑在一条被驯化的恐龙身上击败了霸王龙boss。

宾夕法尼亚大学教授Mollick认为,尽管Fable 5.1在需要判断力和审美的长程工作中确实有实质进步,但说话依然“Claude味儿”十足

在此前,有许多用户反映自己看不懂Claude说话,而这主要源于它一贯“术语生硬堆砌、文本高度压缩”的表达风格。

话虽如此,他还是用Fable 5.1兴高采烈地做了一款复古风游戏,玩家需要在游戏中驾驶一艘太空飞船:

打开网易新闻 查看精彩图片

更多的测试集中在跨模型任务上。

有网友用同一条提示词搭建了一个第一人称视角的3D海洋沙盒场景:

打开网易新闻 查看精彩图片

他自己感觉,Fable 5.1的水准已经相当细腻,堪比3A。

还有网友让Fable 5.1和Kimi K3做同一段视频:

打开网易新闻 查看精彩图片

Fable 5.1用时18分钟,成本12.60美元,Kimi K3用时10分钟,成本6.95美元。

有网友评论:虽然Fable更细节,但自己做的时候,肯定还是会用Kimi的,毕竟更有性价比。

大家觉得哪个效果更好呢?

1

Token效率、Coding、写作、长任务、知识创作……全面测评

除了网友实测,科技媒体Every对Fable 5.1进行了一次更为全面的深测,覆盖编程、写作和知识性工作等多个场景。

首先是大家比较关心的token效率,其用量仅有Opus 5的一半,且处理耗时还是Opus 5的60%。

团队表示,Fable 5.1才是真正的大众之选。

而在Coding与长任务方面,Fable 5.1保持了Fable 5的性能,但是更细节,更完美。

Every团队让模型一次性生成了一个斯坦福AI小镇式的模拟系统——

25 个有记忆、有日常行为的角色,互相聊天,还在镇上传播即将举办的市长选举的八卦。

搭完测试者都有点懵了:“说实话,我不确定模型还不能完成哪些事。”

打开网易新闻 查看精彩图片

深度用户、复合工程学之父Kieran也盖章认可:“现在我直接在会话里就能处理长时间任务,不用频繁切工具了。Fable 5虽然很棒,但用起来太麻烦。而这个版本适合所有人!”

写作和知识性工作是Every评测中表现分化最明显的部分。

团队测算,Fable 5.1在长篇文本写作、尤其是段落续写任务上的表现干翻了此前测试过的所有模型。

并且,AI味也淡了很多,词汇量少了很多——文字难度大概是初一学生水平,比Fable 5低两个年级。

说白了,就是不整那老些诘屈聱牙之作,开始说人话了

在需要更多主观判断的任务中,比如制作幻灯片、撰写人物访谈稿,它的表现也优于GPT-5.6和Sol。

但强大如此,也不是没有短板滴~

在设计方面,Fable 5.1并没有太多长进,配色单一,且作品并不完善。

并且,当任务带有明确限制,比如字数、主题、引用时,Fable 5.1就听不进去话了。

比如,要求输出1000 字,模型交付了1288字;要求提炼3到6个主题,模型给出了8个;要求提取八到十二条引用,模型给出了43条,全对也就算了,其中27条还根本不存在。

Every团队称之为,“总是尽自己最大的努力,做最多的活”。

(其实这也是老毛病了……)

此外,Fable 5.1还有一个不知道算不算毛病的特点。

在开启最高效率模式时,模型会额外调用不必要的子代理协助工作,即便被要求停止,它仍会继续运行。

所以还是要提前设置好预算啊。

基于这些测试结果,Every团队给出了一个大致的使用边界

如果你的任务是协同编程、需要实时调试,或者不希望在长时间任务上等待Fable 5响应,Fable 5.1是更合适的选择;

但如果任务对字数、数量等格式有硬性限制,需要引用内容一次性准确无误,又或者涉及复杂多工具调用且没有提前设定预算,建议优先考虑Opus 5或Sol。

1

One More Thing

此外还有一条信息有点意思。

有网友发现,Fable 5.1在请求删除权限时捏造了用户从未说过的授权话语。

它根本来不及等你,直接提前预判了用户的反应。

打开网易新闻 查看精彩图片

Fable 5.1:bro别整没用的,我猜你的下一句话是……

也不知道这究竟算进步呢,还是退步呢……

参考链接:
[1]https://x.com/arcprize/status/2094894027451539744
[2]https://every.to/vibe-check/fable-5-1-vibe-check
[3]https://x.com/aimlapi/status/2094879208304685524
[4]https://x.com/Hesamation/status/2094864251059867847
[5]https://x.com/alexalbert__/status/2094860187743986169
[6]https://x.com/emollick/status/2094860076028657926
[7]https://x.com/Rubzem/status/2094866225960493189
[8]https://x.com/Bhavani_00007/status/2094913661915779239
[9]https://x.com/TimJayas/status/2094900247000654222

点个爱心,再走 吧