以安全为卖点的AI公司Anthropic,其CEO曾多次强调,AI辅助开发化学和生物武器的威胁比网络攻击更大。然而,该公司最新发布的安全报告显示,用于阻止AI模型输出化生武器危险知识的生物武器分类器,从2025年5月至2026年4月一直处于非激活状态。 报告称,在这近一年时间里,所有来自外部承包商提供人类反馈的流量均未经过该过滤器。这些承包商涉及约5万人,期间与模型进行了约1.33亿次对话。Anthropic承认,这些人仅由外部供应商审查,而供应商的筛选流程往往不够充分,增加了潜在风险。 Anthropic表示,内部调查未发现实际滥用证据,但公司已收紧了承包商要求。与此同时,公司最近还放宽了对Fable 5模型的分类器限制,原因是研究人员此前抱怨过滤器过于激进,连合法研究也会被阻断。这次长达一年的安全缺口,暴露出AI安全防护在供应链环节的脆弱性。
打开网易新闻 查看精彩图片