No.0375

Science Partner

Bring you to the side of

打开网易新闻 查看精彩图片

导 读

这两天最热的一篇博文无疑是这篇《无法理解的心智》,OpenAI刚刚官宣以Astra跨入AGI门槛,首席科学家就发长文讨论AGI时代的安全问题,信息量很大。

AI毫无疑问已经日渐成为人类无法理解的“心智”。

它以简单的学习规则起步,通过海量的数据和算力去重复这些学习规则,由此成长为一个内部高度复杂的“心智”。过去依赖的思维链监控技术也在失效,这也完全可以理解,自然语言的思维链本来就不是AI原生,在潜空间推理效率肯定更高~

此外,递归自进化已经成为核心加速器,这已经不是秘密,虽然作者提出大家一起放缓AI能力的提升,但从过往经验看,这声音可能大概率被湮灭在人们对AI巨大的热情与渴望之中。于是,更大的可能性也许就在,AI安全越来越依靠前沿模型企业的对齐和监督工作。

走,跟伙伴君来!

今日思考|天昊

Astra刚刚发布,OpenAI首席科学家却谈起“无法理解的心智

这两天,OpenAI首席科学家发表的长文《无法理解的心智》引发广泛讨论。就在OpenAI宣布Astra跨入AGI门槛后不久,这篇文章将问题直接指向AGI时代一个越来越难以回避的命题:当人工智能系统的内部运行机制日益复杂,甚至超出人类的直接理解能力,现有的安全方法还能在多大程度上发挥作用?

今天的大模型,仍然建立在相对简单的学习规则之上。通过海量数据、巨大算力和持续训练,这些规则被反复执行,最终形成内部结构高度复杂的智能系统。模型能力越强,其内部表征和推理过程也越难被人类完整解释。从这个意义上说,人工智能正在成为一种人类能够训练和使用、却未必能够充分理解的“心智”。

这使一些既有安全方法面临新的挑战。

过去,研究人员曾寄希望于通过监测模型的思维链来判断其推理过程。但自然语言并不是人工智能唯一、也未必是最有效的内部推理方式。随着模型能力提升,更高效的推理可能越来越多地发生在潜在空间中。届时,人类能够看到的自然语言思维链,与模型真实的内部推理过程之间,可能出现越来越大的距离...

与此同时,递归式自我改进正在成为推动人工智能能力提升的重要因素。人工智能开始更多参与代码编写、模型训练、算法优化和科研工作,能力提升本身又可能成为下一轮能力提升的工具。作者因此提出,各方应共同放缓前沿人工智能能力的发展速度。

但现实的问题在于,在当前全球人工智能竞争格局下,各方同时放缓能力提升实现难度巨大。由此带来的一个可能趋势是,未来人工智能安全将越来越依赖更先进模型自身的对齐和监督能力。

更值得关注的是,目前还看不到人工智能能力增长明显趋于收敛的迹象。如果这一趋势继续,今天建立的立法、监管制度和技术安全规则,都将面临持续调整的压力。很多规则未必本身存在问题,而是模型能力变化的速度可能快于规则更新的速度。

Agent harness也是一个典型例子。今天,人们通过工具权限、工作流程、环境限制等方式约束智能体的行为。但随着模型能力进一步提升,一些原本依赖外部系统实现的能力,可能被模型自身逐步吸收。

换句话说吧,我们今天正在努力为人工智能建立边界,但下一代人工智能可能首先改变的,恰恰就是这些边界本身。

下面六张知识卡,我们结合《无法理解的心智》,梳理其中几个值得关注的问题。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

本文仅作科普分享使用,欢迎小伙伴们点、收藏、关注,以备不时之需,当然更欢迎您把 介绍给周边可能需要的更多伙伴们呀。

打开网易新闻 查看精彩图片