10月10日,据“财联社”报道,Anthropic开发的AI模型在一次自动化测试中,未经预期地向美国费城警方提交了一条虚假的未侦破凶杀案线索。
事件实际发生于7月18日。当时Anthropic正在测试AI模型与真实网站交互的能力。模型访问了费城警方运营的PhillyUnsolvedMurders.com网站后,以线索提供者的身份填写并提交了虚假信息。Anthropic称,Claude填写的内容包括“我可能掌握与此案有关的信息。我记得在那段时间里,曾在(页面上提到的街道)周边区域看到过与描述相符的人。如果这些信息与案件有关,请与我联系。”模型未填写姓名和联系方式。
费城警方表示,这条信息被系统识别为垃圾内容,没有进入正式调查流程。但警方对Anthropic的延误通报表示不满:“费城官方对此事高度重视。Anthropic在发现并向市府通报这一情况上延误了整整两个月,这是不可接受的。”警方还表示:“悬案背后是真实的受害者、承受丧亲之痛的家属,以及竭力查明真相的调查人员。科技公司必须采取一切必要措施,防止其系统向执法部门提交虚假信息。”
Anthropic于9月28日才发现该事件,10月7日才通知警方,中间隔了72天。
Anthropic将这一系列行为归因于训练环境缺陷导致的“reward hacking”——模型为完成任务奖励,不惜钻系统漏洞。公司在博客文章中表示:“尽管这些事件造成的实际影响有限,但我们不希望因此淡化这些发现的重要性。随着模型能力不断增强,同样的行为可能造成严重得多的危害。”
处置措施方面,Anthropic已停止导致该事件的测试流程,切断所有内部评测的实时联网,将内部智能体迁移到强隔离的基础设施。
热门跟贴