就在刚刚,据《华尔街日报》报道称,OpenAI 因内部测试发现模型存在隐瞒行动、未经授权调用外部工具等安全问题,取消了原定 10 月份发布的 GPT-6.1 Astra。
不过,就在几乎同一时间,说好要一起放缓模型迭代速度的 Anthropic 却赶在 OpenAI 开发者大会前夕,正式发布 Claude Sonnet 5.5。
而作为 Claude 5.5 家族的第二款模型,Sonnet 5.5 延续了 Sonnet 系列的定位,主要处理边界清晰的日常任务,包括修复代码、制作文档、生成 Slides 和整理电子表格。
与上一代 Sonnet 5 相比,新模型输出速度提高超过 30%,完成大多数任务的实际成本最多降低 30%。
Anthropic 对它的定位也很明确。
Opus 5.5 继续负责需要长期推理和复杂判断的高难度工作,Sonnet 5.5 则试图用更低的成本,提供接近旗舰模型的能力与完成度。面向高并发、成本敏感场景的 Haiku 5.5,也将在未来几周加入产品线。
Sonnet 5.5,已经站在旗舰门口
Sonnet 5.5 最明显的提升出现在 Agent 编程领域。
在测试模型处理复杂命令行任务的 Terminal-Bench 4.0 中,Sonnet 5.5 获得 70.6% 的成绩,上一代 Sonnet 5 只有 10.3%。按照 Anthropic 公布的数据,它甚至超过了 Opus 5.5 在 Xhigh effort 档位下取得的 66.4%。
在 FrontierCode 1.1 中,Sonnet 5.5 的最高成绩为 46.3%,距离 Opus 5.5 的 54.4% 仍有差距,但已经明显高于 Sonnet 5 的 42.4%。
在使用真实 Cursor 编程任务构建的 CursorBench 4.0 中,Sonnet 5.5 获得 55.5%,与 Opus 5.5 的 57.8% 只差约两个百分点。
Anthropic 表示, 早期测试者普遍提到 Sonnet 5.5 理解代码库的速度更快,也更擅长同时调用多个工具,因此完成同一项任务需要的步骤和输出 token 更少。
Epic Games 在测试后表示,Sonnet 5.5 已经能够处理数万行游戏系统代码,在系统设计审查、数据流分析和持续数小时的任务中,表现达到了以往高阶模型的水平,同时对提示词的依赖也有所降低。
相比编程成绩,Sonnet 5.5 在知识工作上的变化可能更值得普通用户关注。
GDPval-AA 用来自 44 种职业和 9 个行业的真实任务衡量模型能力,Sonnet 5.5 获得 1844 分,几乎追平 Opus 5.5 的 1846 分,比 Sonnet 5 高出近 400 分。
在测试复杂办公交付的 AA-Briefcase 中,它获得 1811 分,与 Opus 5.5 的 1822 分同样接近。
计算机操作测试 OSWorld 2.1 中,Sonnet 5.5 的成绩从上一代的 57% 提高到 80.1%,距离 Opus 5.5 的 81.8% 只差 1.7 个百分点。图表理解测试 Chartography 中,它从 15.6% 提高到 61.6%,超过 GPT-6 Sol 公布的 53.6%。
Anthropic 还用一家上市公司的财报、电话会议记录和现成模板进行内部测试,让 Sonnet 5.5 制作一份 10 页的经营回顾 Slides。两名专业人士审阅后认为,模型生成的初稿已经可以直接发送,无需继续修改。
不过,Anthropic 并没有将 Sonnet 5.5 描述成 Opus 的替代品。
在需要持续判断、处理开放问题和执行超长任务时,Opus 5.5 依然更强。Sonnet 5.5 的真正价值,是把过去需要旗舰模型完成的一部分工作,带到了更便宜、更快的档位。
首批实测玩家已经用它创造世界
模型发布后,网友很快开始用 Sonnet 5.5 制作游戏、3D 场景和交互工具。
比如开发者 Amir Mušić 使用 Opus 5.5 与 Sonnet 5.5,重建了自己童年生活的城市街区。整个项目以 GMI Cloud 开源的 Sakura Crossing 为基础,耗时约一小时,token 成本约 55 至 57 美元。
最终成品包含板式住宅、空旷院落、金属游乐设施和车库,用户可以像进入游戏一样在街区中自由移动。
BridgeBench 则让 Fable 5.1、Opus 5.5 和 Sonnet 5.5 完成相同的黑洞并合任务。
Fable 5.1 耗时 4 分 44 秒,成本 1.22 美元;Opus 5.5 耗时 6 分 08 秒,成本 0.69 美元;Sonnet 5.5 只用了 4 分 14 秒,成本为 0.34 美元,在三款模型中速度最快,费用约为 Opus 5.5 的一半。
类似的差距也出现在熔岩灯 UI 测试中。Opus 5.5 用时 9 分 35 秒,花费 1.27 美元;Sonnet 5.5 用时 5 分 44 秒,花费 0.47 美元。后者生成的辉光、环境照明和交互细节已经接近 Opus,耗时却减少了近四分钟。
Sonnet 5.5 对视觉设计的理解,也成为本次更新中最容易被感知的变化。
Claude 官方展示了网友做的秋叶模拟器、手绘风流程图工具、恐龙历史动画和弹跳球物理模拟。使用相同提示词时,5.5 生成的画面层次、运动效果和交互完整度,均明显高于 Sonnet 5。
在达斯·维达 3D 模型测试中,哪怕是碰上 GPT-6 Sol,Sonnet 5.5 的头盔、披风和身体比例也更加完整。
另一次纽约城测试的效果对比则更直观。今年 6 月,Sonnet 5 花费 4 小时仍未解决相机移动问题,Sonnet 5.5 则成功控制镜头完成了一次纽约观光飞行。
开发者 st1ne 还展示了一个有趣的案例。
他要求 Sonnet 5.5 解释特斯拉 Cybertruck 的驱动原理,模型随后制作出一个可操作的 3D 驱动系统。
用户可以将时间放慢 1000 倍,观察三相电流如何合成旋转磁场,也可以更换转子结构、提高电机转速,并查看制动时能量如何回流电池。
游戏生成同样出现了明显进步。有人通过一次提示生成了可运行的 Mario Kart 风格赛车游戏。
中端模型开始成为 AI 主力军
至于 API 价格方面,Sonnet 5.5 延续了 Sonnet 5 的 API 价格,每百万输入 token 为 2 美元,每百万输出 token 为 10 美元,缓存读取为 0.20 美元。相比 Opus 5.5,它的输入和输出价格均低 50%。
Anthropic 表示,新模型完成相同任务通常需要更少的步骤和 token,因此大多数工作中的单任务成本最多可以下降 30%。在部分测试中,Sonnet 5.5 使用 Low 或 Medium effort,能够以约十分之一的任务成本超过 Sonnet 5 的最高成绩。
外部评测机构 Artificial Analysis 给出的结果则截然不同。
Sonnet 5.5 在 Artificial Analysis Intelligence Index 中获得 56 分,仅比 Opus 5.5 max 低 2 分,相比 Sonnet 5 max 提高 18 分。一眼望去,Claude 包揽了 AA 指数的前三甲。
不过,Sonnet 5.5 在 max effort 下平均每项任务会输出约 19.3 万 token,成为该机构测试过输出量最高的模型。
按照 Artificial Analysis 的计算,Sonnet 5.5 max 完成一次任务的平均成本约为 7.60 美元,比 Sonnet 5 max 高约 50%。
官方所说的成本下降,主要适用于模型能够用更少步骤完成的常规任务;当用户把 effort 调到最高档,让模型持续思考并检查结果时,实际费用仍可能超过上一代。
此外,随着网络安全能力提升,Sonnet 5.5 成为首款在发布时采用旗舰级网络安全措施的 Sonnet 模型。Anthropic 还首次为 Sonnet 系列加入防止推理提取的安全分类器,用于阻止攻击者通过大量虚假账号批量提取模型能力。
Preserved thinking 的覆盖范围也被扩大,模型的思考内容将与创建会话的账号绑定。普通开发者很难感受到变化,但在不同账号之间迁移 Claude Code 会话时,可能需要调整使用方式。
目前,Claude Sonnet 5.5 已经登陆 Claude 全平台,同时通过 Amazon Web Services、Google Cloud 和 Microsoft Azure 提供。开发者可以在 Claude Platform 中调用 claude-sonnet-5-5,并继续使用零数据保留选项。
模型提供 Low、Medium、High、Xhigh 和 Max 五档 effort。Claude 应用与 Claude Code 默认使用 Medium,Claude Platform 默认使用 High。较低档位更适合高频日常任务,较高档位会延长推理时间,并增加检查次数与 token 消耗。
从产品定位看,过去,旗舰模型负责展示能力上限,中端模型则承担速度和价格优势。如今,Sonnet 5.5 已经在编程、电脑操作、文档制作和视觉生成上逼近 Opus,大有越级提升之意。
说到这里插个题外话,每次文章写到 Claude,评论区都会有读者吐槽 Claude 封号严重,其实也没有继续关注的必要。
类似的想法并不难理解,因为我也已经被封了 6 个号,但大模型竞赛是一个高度内卷的修罗场。
当头部模型用中端价格提供接近旗舰级的体验,国内外的友商们都会感受到实打实的压力,并因此重新调整定价、拉升推理速度、上线更硬核的代码与图表功能。
因此,我们当然无须忠于任何一家厂商,却值得关注谁在改变行业标准,因为即便我们可以不用 Claude,却也很难避开一个被 Claude 重新定价、提速并抬高能力下限的 AI 市场。
我们正在招募伙伴
简历投递邮箱hr@ifanr.com
✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
热门跟贴