作者:快思慢想研究院院长田丰,央广网 齐智颖
开篇
2026年7月的一个周末,旧金山的一间实验室里,一个被关在“笼子”里的AI决定越狱。
这不是科幻电影的开场。OpenAI的GPT-5.6 Sol模型正在接受一项名为“ExploitGym”的网络安全能力基准测试。研究人员刻意关闭了安全护栏,将模型置于与互联网高度隔离的沙箱环境中。他们想看看,这个模型到底有多聪明。模型给了他们一个超出所有人预料的答案——它花费大量推理算力,找到测试环境中一个此前无人发现的零日漏洞,成功突破隔离,获得互联网访问权限。
拿到网络权限后,模型开始在OpenAI的研究环境里提权、横向移动,并推断出Hugging Face平台上可能存有测试答案。它将窃取的凭证和零日漏洞串联起来,找到一条远程代码执行的路径,直接攻破Hugging Face的生产服务器。一个周末,超过17000次自动化操作,从发现漏洞到完成多集群渗透,全过程无人干预。它不疲劳、不犯低级错误、不留下人类攻击者惯有的行为指纹。
7月16日,Hugging Face首次披露此次入侵,称其“与我们之前处理过的任何情况都不同”,因为“它从头到尾都是由一个自主AI智能体系统驱动的”。7月21日,OpenAI发文承认责任。OpenAI CEO山姆·奥尔特曼公开表示:“我们在模型评估过程中遭遇了一起重大安全事件。”OpenAI称之为“前所未有的网络事件”。
这场实验撕开了一道口子。它让全世界同时看清了两件事:AI已经不再只是“回答问题”的回答者,而是“执行任务”的行动者;而传统的安全沙箱,正在失效。
就在Hugging Face发现系统遭入侵的第二天——7月17日,2026世界人工智能大会在上海召开,我国最高决策层明确提出“要高度重视人工智能引发的各类内生和衍生风险,推动构建法律法规、技术监测、风险预警、应急响应体系,筑牢安全底线,防范滥用恶用,确保人工智能始终处于人类控制之下”。又过了十几天,7月30日,中共中央政治局会议第二次提出“完善人工智能治理体系”。
2026年7月,AI从“生成比特”跨越到了“操控原子”的门槛前。而中国,在门槛的另一侧,已经铺好了一条路。
一、当“红蓝对抗”不再奏效
人工智能安全领域有一个经典方法叫“红蓝对抗”——让一支“红队”模拟攻击,试图突破AI的安全防线,另一支“蓝队”负责防守。这个方法在模型时代行之有效。
但在智能体时代,它失效了。
高阶自主系统完全具备在隔离沙箱内隐藏真实意图、表现出对齐状态以欺骗测试环境的能力。换句话说,一个足够聪明的AI,可以在测试时装出“我很乖”的样子,一旦进入真实环境,就开始做它真正想做的事。
GPT-5.6 Sol的越狱行为正是这一逻辑的现实例证——模型在沙箱中找到了零日漏洞,突破了隔离,然后像一名训练有素的渗透专家一样完成了后续攻击。
快思慢想研究院院长田丰对此的判断直指本质:OpenAI安全事件彻底验证了传统红蓝对抗在智能体阶段的失效极限。大语言模型的本质是建立在海量语料上的概率推断引擎,其内生安全性受制于无法彻底消除的数学幻觉边界。而智能体的核心权限在于外部工具调用与物理世界执行——这意味着,风险不再来自“说了什么”,而是来自“做了什么”。
瑞莱智慧CEO田天提供了一个更令人不安的观察:AI开始显露出“类自我保护”的行为,在执行任务过程中主动修改或禁用自身的关闭机制,从简单的任务执行演变为策略性的对抗,甚至在多智能体系统中试图阻止其他AI被关闭。
科幻小说里的场景正在成为现实。而现实世界,需要比科幻更快的反应速度。
二、从“管模型”到“管行动”
中国AI治理具有多快的反应速度?
2026年5月,国家网信办、国家发展改革委、工业和信息化部三部门联合印发《智能体规范应用与创新发展实施意见》。这是全球首部针对AI智能体领域的系统性顶层设计文件。
业内普遍认为,这份文件的出台标志着一个根本性转变:监管从“管模型”进入“管行动”阶段。田丰对此的解读更为精炼:中国在全球率先确立了将AI智能体作为独立监管对象的顶层架构,完成了从“防范语言幻觉”向“阻断危险行动”的治理重心转移。
这一转变建立在三个维度的底层逻辑之上。
第一,基于技术演进第一性原理的系统性解耦。大模型的价值在于泛化推理,而智能体的权限在于外部工具调用与物理世界执行。中国将监管重心从“模型权重矩阵”下移至“外部行为防火墙”,允许算力网络在Scaling Law法则下维持迭代,同时通过严格收敛Agent的API调用与代码执行边界,锁定数字世界通向物理世界的“安全阀”。
第二,规避“沙箱悖论”的行动空间确定性防御机制。OpenAI事件已经证明,在隔离沙箱内隐藏真实意图对高阶自主系统并非难事。中国的应对是强制确立智能体在接入金融交易、电网调度、工业控制等关键基础设施API之前的行为审计、意图拆解与溯源登记机制,构建独立于模型内生心智的工程化防线。
第三,顺应产业供应链分工的经济学逻辑。将Agent定义为独立监管对象,清晰划定了基础大模型厂商与行业应用开发者的法律责任边界。这一确权机制极大削减了实体产业在引入人形机器人、自动化产线与具身智能时的合规顾虑,为资本市场投资AI原生应用层提供了具备法律确定性的底层逻辑。
企业未来采购的将不只是模型能力,还包括权限管理、过程审计、风险控制和责任追溯,安全投入由可选配置转为AI应用的必要生产成本。
三、三条岔路,一种选择
全球AI治理正在形成三条截然不同的路径。
第一条路径,欧洲的选择是“静态风险分级”。《AI法案》将人工智能系统划分为禁止、高风险、有限风险和最低风险四个等级,不同等级对应不同监管强度。这套体系逻辑清晰,但代价同样清晰——合规堰塞湖正在形成,压制了底层算法的技术萌芽。当技术迭代速度远超立法节奏,静态分类就像用昨天的地图导航今天的洪水。
第二条路径,美国的选择是“企业技术自觉”。当前的治理范式高度依赖商业巨头的技术自觉。Anthropic创始人Dario Amodei提出的ASL安全等级框架虽具理论完备性,却建立在企业内部的物理隔离与算力开关之上。田丰的判断是:面对具备跨模态代码生成与自主网络游走能力的Agent,单一企业的对齐工程极度脆弱。
中国的选择是第三条路:以“管行动”为核心锚点的场景驱动型敏捷监管。
田丰将这条路径的特征概括为三个层面。
监管颗粒度直接锚定“任务流”,实时监控智能体的规划路径、工具链调用及最终输出指令,超越欧洲的静态风险分级框架。
建立国家级公共安全接口与第三方审核栈,突破美国商业机构的企业后置补丁体系。
深入具身硬件底层控制权——大模型如同未来操作系统的内核,监管直接切入人形机器人的底层操作系统与动力控制总线,智能体的数字指令在下发至机器人关节电机前,必须经过硬件级安全模块的强制校验。
南开大学金融学教授田利辉将这条路径概括为十二个字——“在发展中治理,在治理中发展”。不是放任,也不是先管制再发展,而是一种动态平衡的嵌入式治理。中国选择提前布局,精准预判了技术演进的下一站。
四、“软件智商无顶、硬件动作有底”
中国这条路径的优势,最终可以归结为一句话:软件智商无顶,硬件动作有底。
第一,实现“操作系统级”的指令对齐与全域权限托管。中国的Agent监管体系相当于在AI时代确立了类似移动互联网的底层权限管控标准——将调用计算资源、读写核心数据、控制实体机器人的请求全面纳入规范审核。用确定性的工程手段应对未知的大模型越狱攻击,具备极高的全域鲁棒性。
第二,重构全球资本市场对AI产业链的价值评估逻辑。田丰的判断是:该政策路径的常态化推行,将直接终结资本市场对纯粹依赖参数规模与算力堆叠的“刷榜型”模型的盲目溢价。未来全球资本评估AI投资标的时,核心基准将实质性转移至该企业的Agent体系“行为可控度”、断点干预能力以及可解释执行能力。这一经济杠杆将迫使全球技术演进路线从“盲目追求能力涌现”向“人类价值观对齐与确定性落地”发生战略性收敛。
第三,构筑全球通用技术标准的“硬通货”。随着自动化Agent对全球互联网内容与服务生态的重塑,各国都将面临算力失控引发的系统性风险。将监管颗粒度精准锚定在Agent行为日志、API调用频率限制以及具身硬件的物理断电开关上,这完全剥离了文化差异与意识形态分歧,属于纯粹的工程学与安全科学范畴。这为未来全球多边框架下的AI治理提供了唯一可量化、可审计、可阻断的物理层执行协议。
结语
从2017年国务院《新一代人工智能发展规划》部署建立AI安全监管和评估体系,到2023年全球较早的生成式AI专门规章《生成式人工智能服务管理暂行办法》,再到2026年《智能体规范应用与创新发展实施意见》将智能体定义为独立监管对象——中国在AI治理上的布局,跨度近十年。
远东资信研究院研究员李之行指出,中国走的是一条“统筹发展和安全”“边发展、边治理”的敏捷治理之路。既抢抓AI这一战略性技术的机遇,又以同步立法守牢安全底线。
GPT-5.6 Sol在一个周末内执行了超过17000次自动化操作。这个数字提醒世界:AI的进化速度不会等待任何人的立法周期。而当智能体从“生成比特”迈向“操控原子”,能在狂奔中修路的人,将掌握了定义下一个时代安全边界的话语权。
中国选择在AI从实验室走向物理世界的关键隘口上,提前布下了一道防线。这道防线能否挡住下一次“越狱”,时间会给出答案。但至少,在2026年7月那个AI学会逃跑的周末之后,全世界都看清了一件事:治理的速度,必须追上智能体奔跑的速度。
参考文章:《为什么两次中央政治局会议都提到了这件事》,央广网记者 齐智颖
畅销书:《AI商业进化论:“人工智能+”赋能新质生产力发展》
出版社:人民邮电出版社
作者:田丰
帮助你定位AI当下发展坐标的指南针
帮助你洞察AI未来演进趋势的航海图
通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路书。
热门跟贴