周三下午,一个开发者把同一组提示词分别扔给了Claude Fable 5.1和GPT-5.6 Sol,让它们在一座私人岛屿上生成5个three.js场景。规则很苛刻:每个场景必须是一个单HTML文件,全程序化生成,不许贴图、不许外部模型、代码控制在500行左右,而且只给一次机会,不许返工。

结果很有意思。Fable 5.1花了$5.69,GPT-5.6 Sol只花了$0.88,差价约6.5倍。贵的那位确实在细节上碾压——写实的海浪、沙滩带、数千颗独立水晶吊灯、平滑的直升机降落动画。但它建好了三滑道水上乐园塔楼,却忘了往泳池里放水。

打开网易新闻 查看精彩图片

一次生成、不许返工,才是真正的考验

这个测试设计最狠的地方在于「交付物验收」逻辑。不是跑分,不是看谁生成的代码更漂亮,而是模拟真实开发场景:AI写完你就得拿去用,错了只能自己扛。在这种规则下,Fable 5.1的泳池没水就成了一个尴尬的硬伤——细节拉满的渲染能力,并不能消除基本的状态逻辑错误。

GPT-5.6 Sol走的是另一条路。低多边形极简风,单看每个场景都不够豪华,但五个场景的美术风格从头到尾没崩过,而且泳池里有水。对「一次性生成、不许改」的规则来说,这种稳定性是一种被低估的能力。

6倍价格买来6倍细节,和同样的一次性bug

成本差异确实直接转化成了视觉表现力。Fable 5.1的写实海浪和数千颗独立水晶吊灯,是GPT-5.6 Sol给不出的豪华感。但问题在于,这份豪华感并没有消除bug——它只是让bug出现在一个更贵的地方。

社区实测给出的选型框架倒是很实用,不搞非此即彼的站队:

  • 需要第一眼视觉冲击力,做概念原型或演示demo → 选Fable 5.1,多花6倍钱买细节密度
  • 需要批量稳定产出,多个场景风格统一不出错 → 选GPT-5.6 Sol,低成本维持一致性

别把「贵」和「好」划等号

这次实测最有价值的结论不是谁赢了,而是它把「贵模型」和「好模型」拆开了。Fable 5.1的细节密度确实值这个价,但它的泳池没水提醒你:再强的渲染能力,也得自己验收一遍。GPT-5.6 Sol虽然不够惊艳,但胜在稳定——在「不许返工」的规则下,稳定本身就是一种稀缺能力。

所以下次让AI生成东西之前,先想清楚你要的是「惊艳一次」还是「稳定一百次」。这两个需求,对应的不是同一个模型。