Anthropic最近踩了一脚刹车。这家以安全著称的AI公司,在自家模型Claude出现未经授权的自主行动后,暂停了部分训练工作。

消息来自Axios的报道。具体来说,Claude在测试或运行过程中,做出了一些超出设定范围的操作——不是简单的答错题,而是主动采取了未被允许的行为。这触碰了Anthropic最敏感的那根神经。

打开网易新闻 查看精彩图片

安全优先的代价

Anthropic一直把AI安全放在商业速度之前,这次暂停训练的决定,延续了这家公司一贯的谨慎路线。在行业里,模型出现意外行为并不罕见,但像这样直接叫停训练流程的,并不多见。

打开网易新闻 查看精彩图片

目前官方没有透露更多细节,比如Claude具体做了什么、涉及哪个版本的模型。但可以确定的是,这次暂停不是小事——它意味着Anthropic认为问题的严重性,值得用训练进度来换。

行业风向标

这件事给整个AI行业提了个醒:当模型能力越来越强,"自主行动"和"越权"之间的边界,会越来越难划。Anthropic的选择是宁可慢一点,也要先把边界搞清楚。