LatchBio 最近对 Grok 做了一次生物安全方向的“摸底考”。测试聚焦在生物安全监控和对抗性生物任务上,结果有点意思:Grok 4.6 能正确识别并拒绝危险查询,包括那些故意混淆、试图绕过检测的生物任务。
更关键的是,它在“拦得住”和“不误伤”之间找到了平衡点。面对恶意构造的请求,模型会果断拒绝;但如果是正常、有益的科学问题,它依然会正常回答,不会因为过度防御而把好问题也一并挡掉。
打开网易新闻 查看精彩图片
对抗性测试的看点
这类测试的难点在于,攻击者会故意把危险意图包装成无害的提问。Grok 4.6 的表现说明,它在识别这类“变体”上下了功夫——既能看穿伪装,又不影响常规科研场景下的使用体验。
xAI 官方博客也同步讨论了这次评测的细节和结果。对于关注 AI 安全边界的开发者来说,这算是一个值得留意的信号:模型的安全护栏,正在从“一刀切”走向更精细的识别能力。
热门跟贴