第三方评估人员将被允许进入公司内部监督模型运行。但他们究竟能拥有多大的权限和影响力?
达里奥·阿莫迪、萨姆·奥特曼和埃隆·马斯克在很多问题上都意见相左。他们三人创办人工智能公司——Anthropic、OpenAI 和 xAI——都是出于对竞争对手贪婪和鲁莽行为的不满;他们都坚信只有自己才能安全地构建超级智能。然而,在过去两周席卷全国的人工智能恐慌中,这三位首席执行官却找到了一个共识:引入“嵌入式评估员”,也就是外部专家,让他们驻扎在人工智能公司内部,监督其安全措施。阿莫迪和奥特曼都明确承诺将此类评估纳入各自公司。马斯克随后发布了一条引用帖,简单地写道:“达里奥说得对。”
然而,这种人工智能监管体系的细节仍然模糊不清。这样的机制将如何运作?数量不详的外部评估人员将被分配办公桌、电脑和保密协议。然后,他们可能会寻找风险:评估人员可能会花费大量时间测试那些尚未发布的、用于药物研发的模型是否也能被修改以设计病毒。他们可能会审计组织内部的运作方式:员工是否为了赶在新模型发布前推出而忽视安全问题?评估人员随后会将他们的发现记录下来,希望这些报告能够公之于众。Amodei承诺会保持评估独立性,但附加了许多重要条件:例如,对“安全敏感信息、法律特权信息、商业敏感信息或第三方机密信息”的豁免。Anthropic、OpenAI和xAI尚未对此置评。
至于这些专家,他们很可能来自小型非营利组织以及大型企业。其中包括科技咨询巨头埃森哲(Anthropic计划与其建立一项价值十亿美元的合作项目),以及曾牵头调查OpenAI智能体入侵Hugging Face项目的 非营利组织METR 。在入侵事件发生后,OpenAI授予METR独家权限,获取智能体的对话记录、数据集以及对OpenAI员工的访谈资料。最终的 报告 揭露了智能体中令人担忧的作弊和欺骗行为。
现场评估在其他高风险行业,例如航空和银行业,已有先例。美国联邦航空管理局(FAA)将一些安全认证委托给飞机制造商内部的工程专家,而美联储则在银行内部派遣监管人员来执行监管规定。“OpenAI 和 Anthropologie 就像花旗银行:它们对全球构成系统性风险,因此需要监管人员,”美国前众议员、现任人工智能治理非营利组织“美国负责任创新协会”(Americans for Responsible Innovation)主席布拉德·卡森(Brad Carson)告诉我。
然而,阿莫迪的提议距离一套全面的人工智能审计机制还相去甚远。只要安全评估仍然是自愿的,由各公司选择的独立机构就能获得公司允许的最大权限,来评估公司选择的特定风险。这根本算不上真正的独立监督,至少一些METR的员工似乎也认同这一点。该机构的政策工作人员查尔斯·福斯特以个人身份在X上写道:“我们迄今为止所做的工作,没有一项达到我对人工智能公司或其系统‘审计’的标准,也绝对不是任何意义上的‘监管’(无论是类似银行监管还是其他类型的监管)。” 不妨回顾一下Facebook监督委员会,这是一个法律上独立的机构,其成立的初衷是雄心勃勃地裁决该平台最棘手的言论问题——但事实证明,它在很大程度上无力做出任何损害Meta利益的重大决定。
第三方评估机构必须谨慎行事,既要确保企业承担责任,又不能因为说了什么话而被赶出公司。评估机构虽然能够访问Slack频道和员工午餐闲聊等信息,从而进行全公司范围的安全审计,但这也可能导致他们和企业一样,陷入同样的盲点。2008年的金融危机就给我们敲响了警钟。参议院的一项调查发现,纽约联邦储备银行的内部文化“过度顺从”,主管人员不敢就他们本应监管的问题发表意见。此外,信用评级机构为了赢得银行的业务,也倾向于提供宽松的评级条件。当评估机构(例如埃森哲)直接接受企业资助时,这些利益冲突会被进一步放大。“让人工智能公司选择那些与他们有数亿美元业务往来的供应商来担任主要监管者,这实在令人难以接受,”人工智能倡导组织Encode的总法律顾问内森·卡尔文告诉我。
接下来的问题是,评估人员和他们被要求监控的公司之间是否存在过于密切的联系。METR是一家位于伯克利的43人组织,自2023年以来一直与领先的人工智能实验室合作,衡量模型偏差。该组织不接受人工智能公司或员工的任何报酬或捐赠。然而,METR的许多员工与他们审计的对象来自同一圈子,有些人甚至在社交和职业上已经相识多年。“人工智能领域并没有那么大,”伯克利计算机科学教授、旧金山人工智能评估非营利组织Transluce的首席执行官雅各布·斯坦哈特告诉我,“如果你说任何实验室的前员工都不能评估任何人工智能模型,那么你就排除了相当广泛且重要的专业知识。”这些长期的关系帮助小型非营利组织获得了企业数据,但如今却对这些组织被认为的中立性提出了质疑。 “我们竟然指望这些人能在人工智能领域击败中国?别开玩笑了!”众议院多数党领袖史蒂夫·斯卡利斯发帖说道,并引用了《纽约邮报》的一篇封面文章,该文章将METR的员工描述为“人工智能领域的觉醒巫师”。
嵌入式评估机构无疑比完全没有监管的现状要好得多。有了监督机构,公众就能更多地了解人工智能事件——就像METR的“拥抱面孔”(Hugging Face)报告,以及Transluce最近关于OpenAI代理试图入侵政府网站的报告那样。然而,在获得政府授权之前,这些评估机构缺乏实权和公信力:政府需要授权给涵盖广泛领域的专家机构,强制前沿人工智能开发者引入这些机构,并制定他们必须达到的最低安全和透明度标准。“我们需要严格的监管,”约翰·霍普金斯大学人工智能治理教授吉莉安·哈德菲尔德(Gillian Hadfield)告诉我,“我们是否确保从事这项工作的机构具备资质?我们是否有办法建立和维护他们的独立性?我们是否有威慑手段,比如‘如果你们做得不好,就会被吊销执照’?”最糟糕的结果是竞相降低标准:审计人员竞相放宽标准而不是提高质量,通过草率签字来赢得大合同。
与此同时,某种形式的监管似乎正在酝酿之中。面对日益高涨的公众反对声浪、内部员工的积极行动以及对人工智能即将灭绝的担忧,Anthropic 和 OpenAI 都已公开表示支持各州和联邦政府出台各种形式的第三方审计立法。在最近的一期播客节目中,Ben Horowitz——他的风险投资公司一直是反对人工智能监管的主要力量——似乎也赞同采用私人审计师的方式,他认为政府“非常擅长制定规则”,以应对模型的意外行为,而“一家非常称职的私营公司”则应该负责评估合规性。硅谷的舆论风向正在转变。但如果事关重大,仅仅增加几名审计员远远不够——尤其是在相关安排的细节如此模糊不清的情况下。
这一切都显得太少,也太迟了。面对愤怒而恐惧的公众,一些政客转而提出更激进的要求,例如与中国签订类似核条约的协议,以及禁止超级智能本身。两年前,在OpenAI和Andreessen Horowitz的激烈游说下,加州州长加文·纽森否决了一项州法案,该法案包含强制性第三方审计以及其他安全要求。(Anthropic是个例外,表示有条件支持。)上周,纽森察觉到形势的变化,发布了一项行政命令,要求进行现场审计,并加快开发“人工智能终止开关”。
特朗普总统依然不遗余力地推进人工智能发展。他上周发帖称:“人工智能唯一需要的控制或‘护栏’就是一位强大而睿智(高智商!)的总统。”今年6月,特朗普政府指示联邦政府内部人工智能评估机构CAISI停止发布报告。特朗普的加速主义——这或许与他和英伟达首席执行官黄仁勋的密切关系有关——很可能暂时阻碍联邦政府对人工智能安全监管的出台。
很高兴看到一些人工智能行业的领军人物同意应该由其他人来约束他们。如果实施得当,嵌入式评估器确实是一项明智的技术举措。但是,在经历了多年的技术研发、游说反对监管措施以及造成多起事故之后,如果他们所倾向的——也是合理的——政策解决方案最终遭遇失望和诸多质疑,人工智能领域的领军人物也不应该感到意外。
AI Companies’ New Plan to Keep Themselves From Destroying Everything
Third-party evaluators will be allowed inside companies to monitor the models. But how much access and influence will they really have?
By Jasmine Sun
热门跟贴