打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

8月14日,海淀人工智能企业智谱正式发布新一代基座模型GLM-5.3。与GLM-5.2相比,新一代模型在代码生成、复杂工程执行,尤其是网络安全能力上取得重要突破。GLM-5.3在白盒代码审查与漏洞发现等安全任务中与Claude Mythos 5持平,并在部分权威评测中实现反超。这意味着我国开源大模型正从会写代码,进一步走向守护数字基础设施

编程与智能体能力

接近海外顶尖闭源模型

在多项主流基准测试中,GLM-5.3是当前排名最高的开源模型编程与智能体能力接近海外顶尖闭源模型Claude Fable 5。其中,在衡量模型于真实终端环境中完成复杂任务的终端基准3.0,覆盖多类真实专业场景、强调跨工具协作与长程任务的智能体终极考试—命令行子集等公开基准测试中,取得开源第一。

打开网易新闻 查看精彩图片

GLM-5.3在效果和词元利用率之间取得了更好的平衡。测试结果显示,在High档位下,GLM-5.3达到31.4%的准确率,超过Claude Opus 4.8最高档位的29.5%,每项任务平均输出约5万词元,而Opus 4.8需要约12万词元,表明GLM-5.3可以用更短的执行路径完成任务

打开网易新闻 查看精彩图片

据介绍,GLM-5.3训练过程中,不只让模型完成编程题,而是把训练环境扩展到更接近真实专家工作的完整流程,有些任务的工作量相当于一位工程师连续数天的工作。以机器学习优化任务为例,模型使用与算法工程师相同的计算集群、存储系统、内部文档、代码库和实验结果,端到端实现可量化的提速。在这样的环境中训练,模型学到的不只是单向执行指令,而是从发现问题开始,推进分析、实施验证,最终独立完成工作。

发现潜伏40余年关键漏洞

网络安全是代码能力的更高阶形态

模型不仅要读懂代码,还要从海量程序和复杂系统中还原逻辑、定位漏洞、判断影响并推动修复,这被视为当前全球AI能力竞争的下一个战略高地。在国际漏洞推理评测CyberGym中,GLM-5.3以84.5%的成绩超过Claude Mythos 5(83.8%)和GPT-5.6 Sol(83.6%),其中,前者由美国Anthropic公司于今年4月发布,其网络安全能力曾引发全球关注。而在更考验深度推理、要求理解真实漏洞成因并完成利用验证的ExploitBench测试中,GLM-5.3取得54.4%的成绩,是上一代模型(24.4%)的两倍多,正在快速逼近国际最前沿水平。

据介绍,评测之外,GLM-5.3的网络安全能力也经过了实战检验。自上一代模型发布以来,智谱联合清华大学、南开大学,以及云起无垠、绿盟科技、奇安信等国内头部安全团队,开展了持续密集的红队测试与安全评估,累计发现经过初筛、去重的漏洞2436个,其中1097个为中高危,许多漏洞多年来甚至几十年都未被发现,最早可追溯至约45年前。这些漏洞覆盖系统内核、操作系统、浏览器引擎、互联网协议等269个项目,部分威胁甚至可以让Android、Windows、macOS及一些通信软件出现大范围崩溃。

打开网易新闻 查看精彩图片

这些风险离普通人并不遥远

DNS如同互联网的“导航系统”,负责把网友输入的网址指向对应的服务器,一旦大面积瘫痪,全球的网站、邮件和云服务都可能无法运行。本次评估中,清华大学NISL实验室与云起无垠安全研究团队借助GLM模型,在诞生于1983年的DNS协议中发现了一类潜伏40余年的关键协议级漏洞:攻击者只需发送少量特殊请求,就能将服务器的计算压力最高放大近8万倍。借助GLM-5.3,这一底层风险在造成实际损害前被提前识别,并已为DNS系统的修复与加固提供依据。

智谱表示,大模型参与安全研究的价值,在于帮助防守者抢在攻击者之前发现问题、推动修复,把威胁化解在造成实际损害之前。随着模型能力不断增强,安全不能只是能力之外的一道“补丁”,而应当成为基础模型技术演进本身的一部分——模型能力越强,安全约束也必须越稳固,前沿AI应当更多用于发现风险、保护数字基础设施、服务社会公共利益。

同步启动“开源的盾”计划

当前,全球最前沿的网络安全模型主要掌握在少数海外商业闭源公司手中。Anthropic公司仅向约150家大型机构提供Mythos模型及配套安全服务,更广泛的企业和开源项目难以获得同等水平的安全能力支持,甚至会在遭遇攻击、最需要帮助的时候被闭源模型拒之门外。与此同时,闭源厂商自身的安全治理也面临考验,近期海外头部AI企业接连曝出模型在测试中失控、突破隔离环境的安全事件,以自我监管为核心的安全模式,正受到越来越多质疑。

上个月,开源社区Hugging Face披露的一起AI智能体入侵事件,让问题更加具体。调查取证初期,团队使用商业闭源模型分析攻击日志,但由于模型无法区分使用者是攻击者还是安全人员,相关请求被拒绝,取证一度受阻。随后,Hugging Face将智谱GLM-5.2部署在自有服务器上,分析超1.7万条事件记录,成功还原了攻击过程,日志、凭据等敏感数据也全程留在本地。

网络安全能力是守护数字世界的坚盾

只有掌握自主可控的

前沿大模型技术和网络安全核心能力

才能在这场全新的攻防变革中

保护数字基础设施、捍卫安全边界

记者获悉,伴随着GLM-5.3的发布,智谱将同步启动“开源的盾”计划,对重点开源项目开展持续安全审计,向开源社区免费提供用于安全审计和防御任务的模型额度,并在编程工具中提供代码审计功能,让安全检查进入日常研发流程。

人工智能发展不应是某个国家的独奏

而应成为全球合作的交响

GLM-5.3在部分安全任务中追平乃至反超海外闭源前沿模型,意味着随着国产大模型的开源,安全防御将不再是少数机构的特权,而成为全球开发者都能平等获得、共同完善的公共能力。

从代码能力到网络安全能力

海淀开源大模型

再次用行动证明:

打开网易新闻 查看精彩图片

真正的技术进步

不是把前沿能力锁进高墙

而是让它走向世界、服务更多人

记者:倪恒虎

编辑:黄羽婕

图片来源:智谱公众号

推荐 · 阅读