Claude Sonnet 5.5 和 GPT-6.1 Sol 能不能用 Fable、Opus 或 Astra 成本的一小部分,交出强劲的结果?这个问题被摆上了测试台。

测试方式是在多个提示词上做并排对比,追踪每一代模型的实际成本,再把结果与各自实验室的更大模型放在一起看。

打开网易新闻 查看精彩图片

测的是什么

不是单点跑分,而是把成本作为一条主线贯穿始终。同一批提示词,分别喂给 Claude Sonnet 5.5 和 GPT-6.1 Sol,记录实际花销,再对照各自实验室更大模型的表现。

换句话说,比的不是谁更聪明,而是谁在更低的价位上还能保持能打的状态。

结果在哪看

结果来自 @petergostev,完整内容发布在 YouTube 上,视频链接为 youtu.be/r0ymhRtcTeI。

对于关心推理成本的人来说,这组并排数据提供了一个直接的参照:小模型和旗舰模型之间的差距,究竟值不值那个价差。