AI对齐这件事,至今没人能给出确切答案。Meta首席AI官Alexandr Wang直言,它仍是科学上最开放的难题之一。
他给出的思路叫"可扩展监督":让不同的AI去观察并约束更聪明的AI。监督的一方不能停在原地,也得跟着不断升级,最终形成"越来越聪明的监管智能体"。
打开网易新闻 查看精彩图片
Muse已经在用这套方案
Meta的Muse已经采用了该方案的一个版本。具体做法是,用独立的哨兵智能体去检查主智能体的行为,让监督这件事本身也带上AI的能力。
这套逻辑的关键在于对称:被监督的模型在变强,监督的模型也必须同步变强,否则约束就会失效。Wang没有给出对齐问题的最终解法,只是把"可扩展监督"作为当前可走的一条路摆了出来。
热门跟贴