IT时代网8月8日消息,问一个生物学问题却被AI当成危险请求挡回来,这种尴尬接下来会少很多。美国人工智能初创企业Anthropic昨日发文称,公司正在更新Claude Fable 5模型的生物安全防护机制,目标很直接:把误拦截压下去。
按官方给出的测试数据,此次更新让生物学相关问答的降级现象减少了85%。换个说法,Fable 5如今能处理的生物学任务范围更宽,用户提出的正常学术或科普问题不再动辄触发保守回答。
误拦截为什么会出现,要从防护设计说起。Anthropic承认,确实有恶意用户试图借Fable 5从事生物武器研究这类高风险活动。公司为此给Claude配了一层安全分类器(safety classifiers),专门识别请求是否指向受保护的生物学任务,或是要求生成有害内容。分类器倾向于宁可错杀不可放过,正常问题被误伤便成了副作用。
这次调整动的就是分类器的工作方式,让它在无害问题与高风险问题之间划出更准的界线。
放宽不等于放开。Anthropic表示,出于对持续存在的AI风险的考虑,Fable 5对专业生物学研究和药物开发相关请求仍会保留限制。
模型厂商这两年普遍卡在同一道题上——安全阈值调得太松,风险敞口跟着扩大;调得太紧,专业用户的正常需求又被挡在门外。生物学、化学这类与两用技术沾边的领域,尺度尤其难拿捏。把误拦截率当作一项可量化指标公开出来,某种程度上也是在回应外界对模型“过度保守”的抱怨。
打开网易新闻 查看精彩图片
注:本文中包含AI辅助创作的内容。
热门跟贴