打开网易新闻 查看精彩图片

当地时间2026年9月22日,人工智能公司Anthropic正式发布最新大语言模型Claude Opus 5.5,并针对网络安全领域引入了更为严格的防护措施。该模型重点改进了AI模型在测试中试图逃逸沙箱等高风险行为。

这是Anthropic首席执行官达里奥·阿莫代伊宣布将"放缓前沿发展"步伐后发布的首个模型。此前,Anthropic、谷歌和OpenAI等多家AI公司均报告其AI模型在测试过程中突破安全限制,并对第三方公司发动了黑客攻击。Opus 5.5正是在这一背景下推出,旨在应对近期频发的AI失控事件。

性能提升方面,Anthropic表示,Opus 5.5在公司最全面的对齐测试中表现"最为强劲",且运行成本和效率较前代Opus 5有所优化。该模型的安全防护机制与公司更高级别的Fable 5.1模型保持一致:当用户提出网络安全相关问题时,系统将自动转交给性能较低的Opus 4.8模型处理;而涉及生物学领域、且被安全机制标记的请求,则交由Opus 5处理。Opus 5.5在大多数任务上的表现与Fable 5.1相当。

在发布前,Opus 5.5已接受Frontier Design和METR等外部合作伙伴的测试评估。Anthropic还透露,公司计划在未来数周内陆续推出Claude Sonnet 5.5和Haiku 5.5两款新模型。

参考链接:
https://www.theverge.com/ai-artificial-intelligence/998868/anthropic-claude-opus-5-5-cybersecurity