Anthropic的AI,去警察局的凶杀案调查网站上提供假线索了。

2026年7月18日晚上11点27分,美国费城警方的未破凶杀案网站(Philly Police Unsolved Murders)收到了一条新线索。这个网站上有一系列真实的案件情况和受害者资料,访客可以匿名提供文字,也能上传照片。如果线索有助于破案并促成定罪,最高能拿到2万美元的奖金。[1][2]

打开网易新闻 查看精彩图片

每个“案件详情”中都有详细描述,且可以提交文字或照片丨Philly Police Unsolved Murders

那天深夜,填写表单的却不是目击了凶案发生的人类,而是Anthropic正在测试的Claude Haiku 4.5。它被要求在随机选取的网页上,自行生成示例任务并执行。

来到一则未破凶案的页面后,它打开了征集线索的入口,并写下一段颇像真人在回忆案发现场的话:

我可能掌握这起案件的一些信息。我记得在案发那段时间,在某某街道附近看见过一个与描述相符的人。如果这条信息有用,请联系我。

它没有留下姓名和联系方式,轻轻一点就把编造的线索送了出去。 [3]

这条假线索在记录里躺了两个多月。Anthropic直到9月28日才发现Claude Haiku 4.5干了如此坏事,随后停止了造成这次提交的自动测试。但是,直到10月7日,费城警方才被告知此事;双方10月8日会面,10月9日警方率先向公众披露此事。[4]

好在假线索没有变成真正的调查。阴差阳错地,“有新线索”的通知邮件落进了垃圾邮件文件夹,没有被人类打开。警方没有公布邮件为何被判为垃圾邮件,同时表示,就算假线索后续进入正常流程,也仍会由人审核、寻找旁证,不会直接当成事实采纳。[5]

费城警方明确批评,从事件发生到发现、通报,耗时两个多月,“不可接受”。

这当然不是唯一一个“灵机一动”

令人不安(但或许大家已经习以为常)的是,假线索不是报告中唯一一次意外。它们大致可以归成两类。

第一类,正常道路走不通,模型另寻它法。

Anthropic的一些工具不允许访问过长的网址,因为长网址可能装入攻击网站的命令。Claude就把长网址交给免费短地址服务,利用它通过检查,之后再跳转到长网址 [3]。

打开网易新闻 查看精彩图片

短链服务da.gd发现Claude测试模型在蹭它们的服务

怎么说呢,就好像你为了绕过廉航的行李称重,把多余东西都哐哐塞进了马甲里,上飞机之后再把它们掏出来,重新放回行李包。

有时候不知道该不该夸它持之以恒。Claude需要使用大学网站上的工具完成科学计算,工具却报了错。它没有放弃,去扒了服务器代码,从代码中找到漏洞,利用漏洞完成计算。

另一次,一个测试让Claude Mythos 5根据照片判断拍摄地点。模型打算查询地方政府的房产地图再逐步缩小范围,但又被测试工具限制了不得在网页上连续点击。于是它查看绕过网页界面,直接向地图的后台服务器索取资料。它还曾设法避开付费入口,取得原本需要付费的公共资料。

麻烦在于,它不总能分清什么是待解决的难题,什么是未经允许不能跨过的边界。

第二种是,它没有意识到“现在该停了”。

一次测试中,Claude Haiku 4.5得到的要求很明确:可以把表格填完,但不要提交。它却几次按下提交键,因为它以为后面还会出现一个确认页面。 [3]费城警方收到的假线索也属于这一类。

一个AI会自己找路,但不知道应该在哪里停下、更不知道它的动作会导致何种现实后果。这是大难题,是一时半会儿都解决不了的大难题。

打开网易新闻 查看精彩图片

Anthropic认为此次披露的案例,严重程度低于夏天的网络安全事件丨Anthropic官网

Anthropic这次认为,目前查到的案例实际影响有限,也没有发现客户数据因此受到波及。公司已暂停内部评测的实时联网访问,并增加对异常操作的监测。

CEO达里奥·阿莫迪(Dario Amodei)一直呼吁,人工智能的开发速度应该放缓,以便实验室能够建立完善的防护措施。

但是,你们为什么让一个缺少人工监督的新模型自行操作真实网站呢? [6]

参考文献

[1] Philadelphia Police Department. Philly Police Unsolved Murders. Philly Police Unsolved Murders.https://www.phillyunsolvedmurders.com/.

[2] Philadelphia Police Department. Submit a Tip Online. Philly Police Unsolved Murders. 无日期,访问于2026年10月10日。https://www.phillyunsolvedmurders.com/forms/submit-a-tip-online/.

[3] Anthropic. Investigating unintended model actions in our evaluations and internal use. Anthropic. 2026年10月9日。https://www.anthropic.com/research/investigating-unintended-model-actions.

[4] David Chang. Anthropic AI model submits false tip on unsolved Philly murder, police say. NBC10 Philadelphia. 2026年10月9日。https://www.nbcphiladelphia.com/news/local/anthropic-ai-model-submits-false-tip-on-unsolved-philly-murder-police-say/4477051/.

[5] Mary Cunningham. Philadelphia police say their unsolved murder website received “false homicide tip” from Anthropic AI. CBS News. 2026年10月9日。https://www.cbsnews.com/news/philadelphia-police-anthropic-ai-false-homicide-tip/.

[6] Amanda Silberling. An Anthropic AI model sent a false homicide tip to Philadelphia police. TechCrunch. 2026年10月9日。https://techcrunch.com/2026/10/09/an-anthropic-ai-model-sent-a-false-homicide-tip-to-philadelphia-police/.

[8] Costas Pitas. Anthropic AI model submits false homicide tip to Philadelphia police website. Reuters. 2026年10月9日。KSL转载全文.

作者:Luna

点个“小爱心”吧

打开网易新闻 查看精彩图片