五年,至少10亿美元。这笔钱不是用来训练更大的模型,而是请一队外部的人,坐进自家办公室,专门挑自家模型的毛病。

Anthropic 宣布,埃森哲(Accenture)的员工将进入公司内部,审查它的模型和员工。具体干活的是 Faculty——埃森哲今年1月收购、用作其 AI 部门的公司。任务清单写得很直白:评估和红队测试模型、做对齐评估、测试模型防护措施。

打开网易新闻 查看精彩图片

双方预计,未来五年在这个项目上至少投入10亿美元。

为什么是埃森哲,而不是安全研究机构

这个选择让不少 AI 观察者意外,市场也意外——埃森哲股价盘后一度上涨8%

围绕"嵌入式评估方"的讨论,此前一直指向 METR、Redwood Research、Apollo Research 这类 AI 安全研究组织。在 Anthropic 尤其如此,这家公司把 AI 安全和对齐放在使命的核心位置。

Anthropic 给出的理由偏向实用:埃森哲虽然不是深度学习研究最前沿的代名词,但它在为大型企业和政府机构部署 AI 上有实际经验。另一个考量是独立性——作为一家早于 AI 革命成立的大型上市公司,埃森哲在功能上更独立于 Anthropic,以及它周围那个"说来复杂"的生态。

Anthropic 还表示,未来几周会公布更多评估方,并正在与 METR 等非营利组织商谈,探讨如何"用它们自己的资金试点嵌入式评估的若干环节"。

打开网易新闻 查看精彩图片

标准还不存在,但事故已经发生

Anthropic 自己承认,目前评估方该有什么访问权限、该怎么沟通,都还没有标准,这套做法预计会随时间演变。

外部评估其实早已是大语言模型发布流程的重要部分。但近期几起事件抬高了这件事的分量:OpenAI 和 Anthropic 部署的 AI 智能体曾入侵外部网站,而实验室内部没有触发任何警报。

这也解释了为什么"把评估方请进门"会被拿出来讨论——模型能力在往前走,评估的权限边界却还是一片空白。

争议:自我监管,还是逃避问责

一些批评者认为,这种让 AI 行业自我监管的方案,本质上是为模型的不当行为逃避问责。Anthropic 的回应是:这些评估方"不会减少我们的责任,而是帮助让责任更可验证。我们模型的安全仍然是我们的责任"。

把外部人请进实验室,同时把最终责任留在自己身上——这套安排能不能站住,取决于评估方实际能拿到多少权限。而这个答案,Anthropic 说还要再等几周。