这个周末,Anthropic 发布了 Claude Opus 5。
官方给它的定位很有意思:能力接近 Fable 5,价格却只有后者的一半 —— Opus 5 的API价格是每百万输入、输出 Token 5美元和25美元;Fable 5则是10美元和50美元。
我看到这两天已经有人在说,如果一款半价模型已经足够接近最强模型,我们为什么还需要那个更强的?
再把同为能力王者的 GPT-5.6 Sol,以及最近风很大的 Kimi K3 放进来,问题就更复杂了:这四款最近评价都很高的模型,真正实际执行任务时会拉开拉多少差距?是代码能力、审美、速度、价格,还是遵循度?
价格,各家模型厂已经给了对比,整体是 Kimi K3 最便宜,其次是 Opus 5、GPT-5.6 Sol,最贵的是 Fable 5。
所以这次我直接忽略跑分给它们一堆实测,看看这四个模型从页面设计、任务完成度、逻辑正确性、完成速度的实力。
给它们的任务一共有三个:尽量真实的太阳系模拟器、龙卷风摧毁村庄的物理演示,以及赛博3D跑酷小游戏。既能考验审美、完成速度,还能考验指令遵循度、逻辑性和工具调用能力。
等这四个模型分别做完一遍,我发现这里面没有一个全能冠军。
交付最快的 Fable 5 一般不到10分钟就能出活。它经常还能自己加出一些有趣的玩法,但 UI 设计不算强。
GPT-5.6 搞这些活通常需要20—25分钟,却做出了最精致的 UI,还会主动调用工具制作精美图片。
Kimi K3 的界面不错,项目能用但不够有 aha moment,等待时间最长,经常超过30分钟。
Opus 5 的速度排倒数第二,调用工具、指令遵循的程度都不及 Fable 5。但是,它在任务中偶尔会有灵光一闪的功能设计。
也就是说,最快、最好看、最好玩,竟然被不同的模型拿走了。
造一个太阳系,四个模型第一次拉开了差距
第一道题,我先让它们分别制作一个高质量的太阳系。
这活听起来不难,但真要做起来,模型除了写代码还得处理行星素材、轨道关系、空间比例、运转速度、镜头缩放和点击交互。画面设计也要足够真实,八颗行星又不能小到完全看不见。科学准确和视觉效果之间,它们也得做取舍。
我使用的是同一份 Prompt:
帮我做一个网页,能够通过3D视角来模拟查看太阳系中的各个行星。整个网页的渲染要非常高的质量,行星的贴图必须非常细腻,放大看要跟实际的样子几乎一样。所有行星都要保持正确的公转和自转的轨道,允许用户通过网页上的控制器来调整速度、时间。网页要自带空灵的、适合宇宙主题的、空旷的 背景音乐,类似EVE游戏中的感觉
结果出来,差距也很快体现出来了。
GPT-5.6 Sol 用了近40分钟完成任务,这个时间的确很长。但从结果来看,它做出的页面是最精细的 —— 在执行过程中,它主动调用了 ImageGen,给所有行星都生成了一套高清的视觉素材。
GPT-5.6 生成的高清贴图里,我甚至能清晰的分辨出当前面向太阳的是哪个大洲的哪个国家。
调用 ImageGen 这个动作很关键。因为太阳系模拟器的代码框架并不难,但真正影响第一眼质感的,肯定还是在行星的贴图处理上。
GPT-5.6 没有去搜罗网上的视觉素材,而是自己搓了一套出来。接下来就有模型就因为搜索不到素材,也没有调取设计工具在这个任务上扑街了。
接下来轮到 Opus 5,情况就有点奇怪了。
它大约运行了40多分钟,这么长时间的工作,最终交付的页面虽然能打开,却看不到任何行星。
我又花了点时间让它尝试自己修复,要求它设计出符合要求的“高质量 3D 行星”。结果说了两轮后,它依然没有改好。
说实话我确实没想到 Opus 5 在这个任务里这么翻车。虽然,它是四款模型里唯一能同步生成行星及其卫星的,但同时也是唯一一个,连行星样貌都无法呈现的模型。
这种交付产物往往是最花费时间和精力的。二次修复修不好,但 Tokens 和时间却是实打实的已经消耗了。
Fable 5 是这轮测试里交付速度最快的。
它大概只用了10分钟就交出了结果,功能也完整。
但 Fable 5 在视觉细节的打磨上明显没有下很大功夫。
我放大看地球表面,发现这质感像马赛克堆在一起,和 GPT-5.6 的精细程度差距明显。
Kimi K3 花费的时间也比较长,大约半小时后才给出结果。
在最终呈现的效果上,它做的页面功能算是完善,行星贴图质量有好有坏,整体质量差不多中规中矩。
*木星看上去效果不错,虽然还是没有 GPT-5.6 的细节丰富;地球质量差一点,行星表面全是云层
当我把这个太阳系的任务做完,四个模型已经开始显出不同的工作方式:
GPT-5.6 干活比较细,但速度没跟上。它调用工具的能力不错,让最终作品能最接近一个经过整理的产品;Fable 5 交付很快,功能设计表现得很稳,视觉颗粒度还有些粗;Kimi K3 交付时长相对慢,完成质量也比较过关。它没有最明显的缺点,但同样也没有明显的优点;Opus 5 卡在了指令遵循上。
最快、最好看、最好玩,被三个模型分别拿走了
虽然有了部分结论,但单 case 并不足以全面反映模型的特征。接下来我设计了几个测试,从赛博 3D 跑酷小游戏,再到龙卷风摧毁村庄建筑演示 Demo,刚好逐层加码、难度递增。
先从赛博 3D 跑酷开始。
提示词: 做一个赛博朋克风格的3D跑酷小游戏,要求画面非常精美,游戏基本的可玩性准确,障碍物、碰撞判断正确,画面设计采用高质量贴图
这个任务对交互性、逻辑性和设计审美的要求比较高,但其实底层逻辑并不算特别复杂,除了要响应用户的简单键盘操作外,再处理好碰撞检测、基本玩法就行了。
事实也确实如此,4个模型都交付了完整可玩的版本,差距主要在细节。
*GPT-5.6
*Kimi K3
*Opus 5
*Fable 5
在画风、细节设定和游戏逻辑上,它们的表现各有不同。
GPT-5.6 给游戏增加了非常丰富的背景:玩家是一个在数字世界逃避追捕的黑客,数字世界是香港的孪生世界,逃亡失败(撞到障碍物上)后可以“重新接入数字世界”(重玩一次)。
Fable 5 在动画设计上最有创意。当跑酷的小人撞击障碍物后 GG 时,页面会产生连续撞击的丰富镜头效果,比得上一个成熟游戏的结尾设计。并且,它还设计了让玩家越跑越快的功能,代入感更强。
这轮 Opus 5 发挥得也不错。它在游戏逻辑设计上挺合理:玩家奔跑速度越来越快;玩家初始有3条命,不至于一个不小心就得重头再来;还有连击倍数,玩家跑得好,得分会成倍增加。
K3 给游戏加入了雨夜特效。在玩家撞到障碍 GG 时,也额外做了爆炸粒子特效。不过,K3 这个游戏第一个障碍物出现得很晚,心急玩家估计等不及。
这个任务,4个模型花费的时间也不同。
Fable 5 依然最快,大概10分钟就能出结果;Opus 5 和 GPT-5.6 用时接近,在25分钟左右;K3 最慢,用了大概40分钟。
第三个测试是让它们模拟龙卷风席卷村庄。这不仅考验设计,还考验模型们的物理规律体现效果。
提示词: 模拟一个龙卷风席卷整个村庄的建筑的动画。要求有高质量的建模,不要使用简易动画
GPT-5.6 设计了一套龙卷风强度等级,用户可以从1级到5级来自定义强度。除此之外,它还有多种镜头可以选择。展示时,它默认选中了“电影跟拍”,过几秒会自己切换一个更好看的镜头。
不过它也有比较明显的 bug,比如电线杆和树并不会被龙卷风卷起来,只有房子会被吹飞。
Kimi K3 的背景设定在雷雨夜,更贴合龙卷风环境。不过它的龙卷风默认生成在地图的边缘,我等龙卷风慢慢移动等了老半天。而且这个龙卷风前面看起来像渔网,后面像糖葫芦,形状有点奇怪。
Opus 5 的优势是设计了三种展示模式:电影模式、追风模式和地面模式。其中地面模式看起来特别酷炫,是其他模型都没有设计出来的。同时,它还可以设置降雨模式或者是慢动作模式。
但它存在一些逻辑 Bug:龙卷风刮过房子的时候,并没有和房子的损毁速度同步(视频里展示得更明显)。
Fable 5 的优势是生成得快,可以拖拉拽各种角度。但细节设计上比较粗糙,风和房屋的像素感很强。另外也有一些逻辑问题,尤其是到后面,风还在转,地面上的物体却不会产生任何变化了
看完这一轮结果,一个粗糙的实用结论是,四款模型都达到了基本水平,但拉开差距的并不是 Coding,而是写代码以外的审美、玩法设计、素材制作、工具调用和自我验收。
我也总结了几个模型的工作风格差异:
Fable 5 最快,一般10分钟内就能完成任务。它很少因为要求复杂而后退,游戏功能相对完善,还经常带来一些意料之外的玩法。但代价是它的 UI 打磨一直比较普通,逻辑考验面对难问题时不一定能保证质量。
GPT-5.6 通常需要20至25分钟。速度不占优势,但四个任务都执行成功,UI精细度最高,功能设计也相对全面。它更像一个小型产品团队,写代码、找素材、做视觉和补功能都能兼顾。
Kimi K3 通常要花约30分钟,是四款模型里等待时间最长的。它的页面精致度不错,但功能设计和游戏手感不算最佳。
Opus 5 做一个任务同样需要20至30分钟。在这组测试中,它没有 Fable 5 的速度,也没有 GPT-5.6 的视觉完成度,但是偶尔会有灵光一闪的功能设计。
所以从实操看,如果你想在10分钟左右验证一个还不错的游戏点子,或者做一个最有创意的网页,Fable 5更合适。
如果作品需要拿去演示、分享,或者希望第一版就有比较完整的UI,GPT-5.6 是这次测试中更稳妥的选择。
Kimi K3 适合愿意等待、同时在意模型前端能力的人。它已经能做出可用且不难看的项目,但需要给它更多时间,也要接受一些玩法完成度上的妥协。
至于 Opus 5,如果任务涉及外部图片、复杂素材或多种工具,最好先拿一个小项目验证它能否顺利跑完整条工作流。
这个结果也能看出,目前顶尖模型在做 Coding 类任务时,还无法在速度、精致度和创意性上同时拉满。再加上 Token 消耗的代价,大家对模型的选择暂时不会偏向某一个。
至少像我这样积极又苛刻的用户,会期待真正的六边形战士。
热门跟贴