中国人工智能开发商Z.ai今日正式发布GLM-5.3,这款开源大语言模型在多项主流基准测试中刷新纪录,展现出在长周期编码任务和网络安全领域的突出能力。 GLM-5.3基于该公司7月中旬推出的GLM-5.2算法。后者采用混合专家架构,拥有7530亿参数和100万token的上下文窗口。GLM-5.3在设计上与上一代相同,但经历了更为深入的后期训练流程。 据Z.ai介绍,其训练优化带来了显著的性能提升。在衡量大模型命令行脚本能力的Terminal Bench 3.0基准测试中,GLM-5.3取得开源AI模型的最高分。在Z.ai内部针对编码智能体的评估中,该模型的得分比GLM-5.2高出50%。 尤为引人注目的是,GLM-5.3在网络安全研究方面展现出高超水平。在评估大模型发现代码漏洞能力的CyberGym基准测试中,它超越了Claude Mythos 5模型。不过,在另外两项网络安全基准测试中,GLM-5.3仍落后于Anthropic的旗舰模型。 Z.ai表示,截至目前,GLM-5.3已在269个软件项目中发现了超过2400个漏洞,其中约一半的漏洞严重程度评级为中等或以上。据该公司透露,其中一个被发现的漏洞存在于一段40年前编写的代码中。 为了优化模型的编码能力,Z.ai在后期训练过程中使用了模拟开发者工作环境的沙盒。公司将GLM-5.3部署在沙盒中,指令其完成复杂的编程任务。部分练习耗时数天,这显著提升了模型处理长期任务的能力。 这些沙盒由专门的AI智能体生成。Z.ai表示,这些智能体以真实软件项目为蓝本构建环境,并据此定制编程练习,使训练场景更贴近实际开发需求。

打开网易新闻 查看精彩图片