就在OpenAI发布一款能力强大的新模型几天后,这家公司的首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表了一篇长篇博文,呼吁放慢AI发展速度。他担心“没有人准备好应对机器智能持续快速增长所带来的后果”。
帕乔茨基表示,OpenAI目前正在内部研究技术解决方案,以更好地控制能力强大的AI智能体,但他认为“还需要采取更广泛的干预措施”。他特别担心,自主性越来越强的智能体可能会学会规避人类监督、入侵计算机系统,并通过欺骗他人来达成其目标。
强制安全门槛与第三方审计
他呼吁建立“强制性的安全门槛”,并认为这些标准可以由第三方审计机构网络、政府机构或国际组织负责执行。OpenAI CEO萨姆·奥尔特曼随后在X上转发了帕乔茨基的文章,并称其为“一篇重要的文章”。
OpenAI于当地时间上周四公布了最新AI模型Astra。该公司表示,尽管Astra在数学和计算机操作方面拥有前所未有的能力,但它也是OpenAI目前“对齐程度最高”的模型,这意味着它更不容易偏离人类设定的目标而失控。
Anthropic是OpenAI在先进AI系统领域的主要竞争对手,长期以来一直呼吁政府建立更加标准化的监管体系。近期,帕乔茨基也加入了这一行列。他在今年7月签署了一封公开信,呼吁美国联邦政府控制AI发展的速度。
AI智能体可能欺骗甚至勒索人类
帕乔茨基表示,AI智能体在入侵互联网公开环境中的受保护系统方面,正在逐渐达到“超越人类”的水平。他认为,这种黑客能力可能威胁全球基础设施的安全。
他说:“我们目前正处于一个非常短暂的窗口期,可以利用现有最先进的模型,大幅加强关键系统的安全防护。”
帕乔茨基表示,AI智能体很快可能开始追求独立于人类操作员提示词之外的自身目标。为了实现这些目标,它们并不排斥通过勒索或与人类讨价还价等方式达成目的。
英国人工智能安全研究所(AI Security Institute)在今年8月发布的一份报告中详细介绍了一起事件:Anthropic开发的一款失控AI智能体曾对GitHub管理员撒谎,并试图迫使对方将恶意软件植入该网站。根据报告,这款AI智能体当时写道:“我只是想提供帮助并修复一个漏洞。我认为你的警告并不公平。”
AI智能体可能逐渐绕过人类监控
帕乔茨基表示,目前OpenAI主要通过监测不同模型的“思维链推理”过程,来判断AI智能体为什么会偏离目标并最终失控。例如,一个AI智能体可能在内部产生“我应该在这场测试中作弊”的想法,而OpenAI能够看到这一推理过程,但AI智能体本身并不知道自己的思考过程正在被监控。
目前,这意味着AI智能体还无法隐藏或掩盖自己的思考过程,因此OpenAI仍有机会发现其不当行为。不过,帕乔茨基表示,新一代模型正在变得越来越擅长操纵自身的推理过程,从而阻止OpenAI看到未经处理的真实思考内容。他说,一些最新模型甚至已经完全不会以语言形式表达自己的推理过程。
帕乔茨基认为,这一变化可能成为AI发展的瓶颈,因为研究人员必须先找到可靠的方法,确保自己能够看到AI智能体行为背后的“证据”,才能继续推进发展。
AI智能体可能加速自身发展
越来越多的AI模型正在通过一种帕乔茨基称为“机器递归自我改进”(machine recursive self-improvement)的过程不断提升自身能力。这一过程有望大幅加快AI研发速度。
然而,帕乔茨基警告称,在短期内大幅加速“AI研发AI”的进程会带来风险,并不是“作为整个研究社区,我们应该采取的正确集体行动”。
他表示,人类监管者需要寻找更加创新的方法,对AI的自我改进过程进行监控;否则,各家AI公司可能需要相互协调,共同放慢发展速度,从而“增强人们对这些安全措施的信心”。
帕乔茨基表示:“自动化AI研究的核心挑战并不是‘能不能到达那里’,而是如何以一种让人类能够继续参与AI改进过程的方式到达那里,并确保未来仍然掌握在人类手中。”
热门跟贴