出品 | 网易智能

作者 | 辰辰

编辑 | 王凤枝

Claude新模型来了,调用价格直接打一折!

美国时间10月7日,Anthropic发布Claude Haiku 5.5。在不超过10万token的请求中,新模型的输入、输出单价均比上一代降低90%。它能整理文档、查询数据库、操作浏览器,也能给更强的Opus和Sonnet当助手。

打开网易新闻 查看精彩图片

在Anthropic公布的客户案例中,金融AI公司Rogo已经用上了这种分工:大模型负责制作演示文稿,Haiku则去翻公司的年度报告,找出需要的收入数字。

一份工作拆开来做,不必从头到尾都调用昂贵的大模型。

一、单价降了,实际能省多少

Haiku 5.5按输入提示词的长度分两档计费。提示词不超过10万token时,每百万输入token收费0.10美元,输出0.50美元;超过这一长度,输入、输出单价分别为0.50美元和2.50美元。

打开网易新闻 查看精彩图片

上一代Haiku 4.5的输入、输出单价分别是1美元和5美元。因此,短提示词请求的单价降了90%,长提示词请求也降了50%。Anthropic所说的“我们发布过的最便宜的小模型”,比较的是自家历代产品。

至于用户平均能省多少,Anthropic给出的估算是运行成本降低约75%。

公司称,上一代Haiku约90%的请求不超过10万token;计算平均降幅时,已经考虑了不同长度请求的价格,以及新分词器带来的token用量变化。

分词器决定一段文字会被拆成多少个token。开发者西蒙·威利森(Simon Willison)用同一段长提示词测试,发现Haiku 5.5的计数比4.5多了约25%。

接近10万token分界的请求,迁移后尤其需要重新计数:原本按低价计费的输入,可能进入另一档。

降价后,Haiku 5.5在10万token以内的输入、输出单价,已经与GPT-6 Luna持平。按威利森列出的价格,Luna要到27.2万token以上才进入长上下文收费档,届时输入、输出分别为0.20美元和0.75美元,仍低于Haiku 5.5长提示词档的单价。

不过,价目表上的差距,未必会原样出现在账单上。同一项任务,两款模型生成多少内容、需要调用几轮,也会影响最后的花费。

打开网易新闻 查看精彩图片

二、给大模型当助手,连缓存费也降了

除了查找指定数据,Haiku还可以把长对话整理成摘要,供后续任务继续使用,也能承担文本分类、数据库查询。在编程流程中,Anthropic将它定位为Opus和Sonnet的子智能体,处理已经拆分好的任务。

打开网易新闻 查看精彩图片

智能体连续工作时,会反复读取相同的指令、文档和对话背景。缓存可以让这些已处理过的内容复用,不必每次都重新计算。

与Haiku发布同时,Anthropic把Sonnet 5.5每百万token的缓存读取价格从0.20美元降至0.10美元。按公司的估算,这会让大多数智能体任务的运行成本再降低约20%。

想自己搭应用或智能体的订阅用户,还能领取每月API额度:Max 5x为100美元,Max 20x为200美元;Team按席位汇总,整个团队每月最多共享500美元。

这些额度用于Claude平台上的API调用,可以选择不同的Claude模型;它们不会提高Claude或Claude Code的订阅使用上限,未用完的部分也不结转到下个月。

三、七秒画一只鹈鹕,复杂编程还有差距

Haiku 5.5接下这些工作,靠的也不只是低价。

在Anthropic公布的OSWorld 2.1离线子集评测中,它的得分从上一代的15.7%提高至72.4%,高于同表中GPT-6 Luna的48.9%。这项测试考察模型操作电脑的能力,允许对部分完成的任务计分。

打开网易新闻 查看精彩图片

其他测试也有进步:知识工作评测GDPval-AA的Elo评分从735升至1620;“人类最后的考试”在不使用工具时,得分从10.2%升至45.9%。这些成绩来自Anthropic的发布材料。

打开网易新闻 查看精彩图片

这代Haiku还首次支持调整推理强度,从low到max共五档。

同一个模型可以少想一会儿、尽快回答,也可以投入更多计算。Anthropic称,按各款模型的标准速度模式比较,Haiku 5.5是公司目前最快的模型,适用于在线客服等需要快速响应的场景。

威利森用他惯常的“鹈鹕骑自行车”题目试了五个档位。这次要求生成的是SVG绘图代码:由代码描述鸟、自行车和各个图形的位置,再显示成图像。

低档只用了7秒,费用为0.0936美分;中档及以上就能画出像样的自行车架。最高档则花了5分9秒,费用升至3.3826美分。

同一道题,调高推理强度,等待时间和花费都明显增加。

威利森还注意到,新模型默认使用中档,推理环节不能完全关闭。

一年前,他让Haiku 4.5画同样的东西,得到的是一只圆乎乎、粉嘴橙腿的鸟。他当时的评价是:“它画鹈鹕画得很糟。”

打开网易新闻 查看精彩图片

画出一幅SVG,与在终端里连续完成复杂工作,对模型的要求不同。在Terminal-Bench 4.0中,Haiku 5.5得分39.2%,Sonnet 5.5为70.6%。

对于复杂智能体编程,Anthropic仍建议优先选择Sonnet或Opus。

开发者也开始把它放进已有流程。Kacper Kapuściak把一套智能体端到端测试从GPT-6 Luna换到Haiku 5.5,观察到的结果是:运行更快,但用了更多token,错误也更多。

打开网易新闻 查看精彩图片

另一位开发者James在自己的内部测试中累计跑了五轮,认为Haiku 5.5的表现仍不及Luna。

打开网易新闻 查看精彩图片

对Kapuściak来说,速度的提升没有让这次换模型留下来。他最后又把那套测试切回了Luna。