Anthropic近日宣布,已对AI模型“Claude Fable 5”的生物学领域安全措施进行更新。此前被不少用户抱怨“过度谨慎”的问题得到明显改善,由于误判而将普通生物学问题切换到备用模型的概率,已减少约85%。 Claude Fable 5拥有很强的生物学理解能力,但这也意味着它可能被恶意利用,例如辅助开发生物武器。为了兼顾安全与实用性,Anthropic在发布之初曾对生物学相关问题设置了极为宽泛的限制范围。一旦问题被判定为敏感,系统就会将其切换至生物学能力相对较弱的“Claude Opus 5”处理,以避免高风险内容被直接解答。 问题是,旧策略过于保守。许多用户的真实需求也被误伤,比如查询体检报告、学习基础生物学知识,甚至一些医疗工作者提出的常规临床问题,都可能被判定为“太危险”而遭到回退。也就是说,为了不放过任何危险提问,系统把大量正常提问也一并拦截了。 此次更新从三个方面入手:重写分类规则、更新训练数据,并对安全分类器进行了重新训练。从Anthropic公布的对比图来看,原先覆盖范围很大的“安全余量”被大幅收窄,安全提问的通行空间明显扩大。实测中,与生物学相关的回退量下降了约85%,普通用户和医疗人员使用Fable 5完成日常任务时,不再频繁遭遇“答不了”的情况。 不过,这并不代表安全防线被完全拆除。涉及病毒学毒物学、分子设计等可能具有双重用途的专业问题,仍然会被切换到Claude Opus 5处理。Anthropic表示,未来会继续在降低误报的同时,让研究人员能够安全地使用Fable 5的高级生物学能力。

打开网易新闻 查看精彩图片