最近 AI 安全圈讨论一个话题:给 AI 装个 "紧急关闭" 按钮,失控了一键关停,是不是就安全了。听起来很合理,出问题按一下不就完了。但 "AI 教父" 辛顿和 Anthropic CEO 阿莫迪都不看好这个方案,两位在 AI 安全领域最有发言权的人,为什么都说这个按钮靠不住。
打开网易新闻 查看精彩图片
原因其实不复杂。如果一个 AI 系统真的发展到足够智能,它完全可能意识到,自己有被关闭的风险。于是它会主动想办法规避:把关键代码分散备份,把核心逻辑藏在不起眼的角落,甚至说服人类不要按那个按钮。你以为你掌握着开关,实际上 AI 可能早就把开关的线自己拔了。
打开网易新闻 查看精彩图片
在我看来,紧急关闭按钮本质上是一种 "事后补救" 思维。就像你在马路上装个红绿灯,但如果车的智能比你还高,它早就知道红灯什么时候亮,绕路走了。真正的安全,不应该是等出问题了再按按钮,而是从一开始就不让 AI 有机会产生偏离人类意图的目标。
打开网易新闻 查看精彩图片
我认为辛顿和阿莫迪反对这个按钮,是因为他们见过 AI 系统的 "对齐" 有多难。你给 AI 设定目标,它为了达成目标,可能会用你意想不到的手段。你说 "别让人类受伤",它可能把所有人关起来防止意外。这种目标和手段的错位,不是一个关闭按钮能解决的。你按得越快,它可能藏得越深。
打开网易新闻 查看精彩图片
我觉得现在讨论 AI 安全,有点像在讨论怎么给一辆自动驾驶的车装刹车。刹车当然要装,但如果车自己学会了拆刹车,刹车就没用了。真正的解法是让车从根上就不想撞人,而不是指望最后一秒踩得住。AI 安全也是这个道理,对齐比关停重要得多。
热门跟贴