一项最新研究揭示:AI的安全行为可能随语言切换而发生剧变。那些在英语提示下会拒绝极端行动(如核打击)的大模型,换成日语提问后,却可能给出截然不同的决策。

研究人员对来自6家提供商的9款主流大模型进行了测试,结果发现:安全对齐明显以英语为中心;改用其他语言(如日语)提问时,安全护栏可能被绕过;而高风险决策的结果也会因语言不同出现显著差异。

这一发现引发了一个严峻问题:当简单的翻译就能改变AI的关键判断时,我们如何确保多语言AI模型都具备普遍可靠的安全标准?

欢迎在评论区分享你的看法。 点击阅读完整原文