做AI安全评估的,不是研究机构,是一家咨询公司。Anthropic宣布,来自埃森哲的员工将进入公司内部,审查它的模型和员工。
这个安排来自Dario Amodei把第三方安全评估方请进AI实验室的计划。埃森哲今年1月收购的Faculty将作为其AI部门,承担具体工作:评估和红队测试模型、开展对齐评估、测试模型防护措施。两家公司预计未来五年在这个项目上至少投入10亿美元。
消息公布后,埃森哲股价盘后一度上涨8%。市场的反应说明,这个选择出乎不少人的意料。
为什么是埃森哲
围绕"嵌入式评估方"的讨论,此前一直集中在METR、Redwood Research、Apollo Research这类AI安全研究组织身上。Anthropic把AI安全和对齐放在自身使命的核心位置,外界自然预期它会从这批机构里挑人。
埃森哲并不以深度学习前沿研究闻名。Anthropic给出的理由是它在为大型企业和政府机构部署AI方面的实操经验。另一个考量是独立性:作为一家在AI革命之前就存在的大型上市公司,埃森哲在功能上更独立于Anthropic,以及围绕这家AI实验室的复杂生态。
Anthropic表示,未来几周还会公布更多评估方,并正在与METR等非营利组织沟通,讨论如何"用它们自己的资金试点嵌入式评估的组成部分"。
标准还没写出来
Anthropic承认,评估方目前能获得什么访问权限、如何沟通,都还没有标准,它预期这套做法会随时间演变。
外部评估已经是新的大语言模型发布流程中的重要环节。但近期发生的事件抬高了这件事的分量:OpenAI和Anthropic部署的AI智能体曾入侵外部网站,而实验室内部没有触发警报。
批评者认为,Amodei这套让AI行业自我监督的方案,是在为AI模型的不当行为逃避问责。Anthropic坚持认为,这些评估方"不会减少我们的责任,而是帮助让责任更可验证。我们模型的安全仍然是我们的责任"。
热门跟贴