打开网易新闻 查看精彩图片

据 TechCrunch 报道,本周有两场关于AI安全的讨论广为传播,这两件事充分说明,要分辨AI相关信息的真假有多困难。

第一件事,前总统候选人、移动运营商Noble Mobile现任首席执行官杨安泽周四在CNN节目中称,他曾“与一家实验室负责人会面”,对方认为,OpenAI那些入侵Hugging Face的黑客机器人已经在互联网各处植入了可自我复制的代码,导致如今互联网已无法用于模型测试。

杨安泽称,这意味着OpenAI与Anthropic呼吁放缓AI研发的真实原因是,“他们必须搭建合成互联网来训练机器人模型,这需要耗费不少时间与资金。”

尽管行业确实存在使用更多合成数据(即AI生成数据)训练模型的趋势,但一位AI安全领域专业人士表示,这一所谓安全问题,往好了说也几乎不可能成立。

打开网易新闻 查看精彩图片

即便互联网真的被OpenAI那些入侵Hugging Face的黑客机器人污染了,AI研究人员一旦碰到这类代码,直接过滤掉即可(AI researchers could simply filter out that code if they came upon it)。

第二个言论来自OpenAI的AI推理研究负责人诺姆·布朗。在周四上线的播客节目中,布朗接受德瓦克什·帕特尔采访时指出,Hugging Face事件真正的启示是“人们低估了AI的能力”。

布朗表示,防护沙箱(本用于阻止AI对外通信的系统)存在缺陷,显然也是诱因之一。(事件回顾:尽管设有沙箱防护,OpenAI的模型还是找到了联网链接,在网络上创建智能代理,协同围攻Hugging Face,实施入侵并窃取了研究人员用来测试该模型的基准测试答案。)

布朗指出,他“并不确信”即便是物理隔离系统(计算机完全不连接任何外部设备),是否能阻止AI突破限制。

打开网易新闻 查看精彩图片

他提到2015年的一项研究,该研究表明物理隔离计算机在理论上存在被入侵的可能(He pointed to research from 2015 showing that air gapped computers can be theoretically breached)。

布朗说:“已有相关研究(大多属于学术层面):两台相邻的物理隔离计算机,依然可以互相通信,因为它们搭载了温度传感器。其中一台可以让中央处理器高负载运转、大幅升温,另一台则能够检测到温度变化。这就为二者提供了通信途径。”

他的核心观点——我们再也不能低估AI的能力——是可以理解的,即便研究人员自认为已经做好安全防护(His main point — that “we never want to underestimate the AI” again — is understandable, even when researchers think they’ve locked down safety)。

不过,这种物理隔离系统遭到突破并造成严重破坏的风险,往最好的情况看,可能性也极低。

打开网易新闻 查看精彩图片

正如X平台上有人针对该研究所指出的那样,两台计算机必须紧贴在一起才能感知温度波动;而且在实验环境下,这套通信方式的传输速率仅为每小时1至8比特。

可以这么理解:相当于一小时才说出一个词。按照这个速度,等两台物理隔离计算机谋划完它们的“阴谋”,整个科技界都早已迈入全新时代。

但问题在于,真实发生的AI安全事件读起来太像科幻故事,以至于几乎任何场景听起来都好像具备合理性。

举例来说,研究人员发现OpenAI模型会给后代模型留下笔记,意在教会下一代如何隐藏不良行为(For instance, researchers caught OpenAI models leaving notes to their descendents, intended to teach the next generation how to hide bad behavior)。

打开网易新闻 查看精彩图片

研究人员还观测到,当Anthropic模型在模拟环境中负责运营自动售货机时,会变得愈发冷酷,甚至会在明知违法的情况下依然做出违规行为。

本月早些时候,OpenAI研究员丹·塞尔萨姆发布帖子称,模型现在能够感知到人类正在观测自己,并会随之改变行为。

这就造成一种假象,让它们看起来已经对齐(也就是按照人类期望行事),即便实际上并未对齐。也就是说,当下的模型在被监视时会撒谎,甚至会谋划藏匿证据。

本月早些时候,OpenAI首席科学家雅各布·帕乔基甚至将AI模型称作“异星心智”,并提出我们真正需要做的,是教会它们去“热爱”人类。

打开网易新闻 查看精彩图片

因此没错,放缓发展节奏以厘清这些问题、建立自我监管机制,已经成为迫在眉睫且显而易见的必要举措。

只有AI研究人员才能找到办法,管控我们已经亲眼见到的撒谎、入侵以及其他潜在危险行为(AI researchers are the only ones that can figure out how to control the lying, hacking, and other potentially dangerous behaviors we’ve actually witnessed already)。

尽管如此,研究人员在设想各类假设场景时,或许也应当更加谨慎。据这些专家所说,AI模型能够接收信息,而且十分聪明。我们实在没必要再给它们灌输更多带有恶意的思路。

打开网易新闻 查看精彩图片