随手先关注,不错过每日AI热讯速递
2026 年 8 月 16 日,据 The Decoder 报道,Anthropic 在此前发布的安全报告中披露:其用于阻断化学/生物武器危险知识提取的分类器,从 2025 年 5 月到 2026 年 4 月失效了近一年[1]。
这个本该拦下危险知识的安全闸门,静悄悄地停摆了将近 12 个月。
①
这些分类器(判断模型输出是否涉及生化武器危险知识、并予以阻断的过滤系统)的作用,是防止 AI 模型被用来提取化学或生物武器的危险知识[1]。
失效期间,所有来自外部承包商的人类反馈(人工对模型回答进行评分标注,用于后续训练对齐)流量,都未经这些过滤器直接流过[1]。这批承包商大约有 5 万人,累计产生了约 1.33 亿次与模型的对话[1]。
图:Anthropic 安全报告原文截图,披露生物过滤器失效的时间段(来源:The Decoder[1])。
②
Anthropic 的解释是:这些承包商仅由外部供应商审查,而供应商的筛选流程往往不够充分[1]。它同时强调,内部调查没有发现任何滥用的证据[1]。
但「未发现滥用」不等于「未发生滥用」。过滤器失效近一年才被发现,这本身就让外界对它的安全基础设施可靠性打了个问号。
③
尤其讽刺的是,Anthropic 的 CEO 曾反复强调,AI 辅助开发生化武器是比网络攻击更大的威胁。如今自家拦生化武器的过滤器却宕机近一年。
对一个把「安全」当作品牌核心卖点的 AI 公司来说,这次披露的分量,比一次普通的服务故障重得多。它暴露的,是安全控制在日常运维中被长期忽视的隐患——而这恰恰是安全承诺最该被检验的地方。
这次披露只是 Anthropic 那份冗长风险报告的一个片段。报告还披露了内部模型、多智能体集体偏航等一系列安全发现,而过滤器失效是其中最扎眼的一条。
欢迎大家在评论区聊聊:过滤器宕机一年才被发现,你们认为是运维失误还是安全投入的警钟?
参考来源:
[1] The Decoder:Anthropic's bio-weapons filter was down for nearly a year, exposing 133 million requestshttps://the-decoder.com/anthropics-bio-weapons-filter-was-down-for-nearly-a-year-exposing-133-million-requests/
欢迎分享、点赞、推荐
一起拥抱AI
热门跟贴