7月24日,Anthropic正式推出新模型,直接将1M token上下文窗口和128k最大输出定为硬指标,不提供更小的上下文变体。官方把这次升级定性为“阶跃式改进”而非渐进优化,最大的提升集中在深度推理、智能体编码、长线任务及测试时计算扩展上。

定价与上代持平,但Anthropic直说它能以半价逼近Fable 5级别的智能。这个坐标让价格和能力的关系一下子变清晰了:不是压着成本做小升级,而是在同一成本线上把推理和工具使用推高一档。对长期把Claude嵌在工作流里的团队来说,每token换到的有效产出开始出现质的偏移。

打开网易新闻 查看精彩图片

能力清单几乎全指向实战环节。代码审查和缺陷发现中,新模型对真实缺陷的命中率高、误报率低,即使设置在较低的努力档位也保持稳定。视觉方面,阅读图表、文档和示意图的能力明显提升,当模型拥有裁剪和自检工具时,还能复现UI和前端视觉。

办公与文档任务上,它可以生成包含真实公式的多工作表电子表格,并制作结构化的演示文稿。多智能体协同中,它能运行多个子智能体,采用“编写-校验”模式,减少智能体之间互相踩踏产出的情况。

组合起来传递了一个信号:这并非为单人问答设计的聊天助手,而是为长时间运行的智能体环、编程会话或多步骤工作流打造的。它的目标用户是那些不必每一步都介入检查,让模型在工具使用循环里保持任务状态的团队。

1M token上下文窗口既是默认配置也是最大配置。Anthropic称,指令遵循、工具调用和推理质量在整个窗口内保持一致,不会在末尾段滑坡。长上下文工作中最要命的往往就是后段衰减,如果这一承诺兑现,上下文能力的可用长度将被实实在在地拉长。

推理思维的开启方式也变了。上代默认不思考,除非显式要求;新模型改为默认开启,由模型自行决定每个回合需要思考多少、思考多久。用户现在控制的是“努力”级别,分为low、medium、high、xhigh和max五档,其中high为默认值。

Anthropic建议从high起步,质量没问题就向下调以省token和延迟,遇到最难问题时再向上推。这种思路把计算资源分配变成了一个可权衡的连续变量,与过去简单开关思考功能的做法完全不同。

从能力到定价再到推理策略,该模型传递的信息一致:在一个智能体需要独立做长程操作的世界里,上下文保真度、输出长度、思考弹性和不变的价格,比跑分截图上的单项数字更能决定模型的可用性。