智谱今日发布新一代推理模型GLM-5.3。在底座模型与GLM-5.2相同的基础上,新模型通过优化训练Scaling,在编程与智能体任务中实现大幅跃升,并展现出更强的网络安全能力。
在多项基准测试中,GLM-5.3斩获开源模型第一。内部评测显示,其编程能力较前代提升50%。在主流基准测试中,GLM-5.3是目前最强的开源模型,编程与智能体能力接近Claude Fable 5,编程水平超越其他国产模型。
在衡量模型在真实终端环境中完成复杂任务的Terminal-Bench 3.0中,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程中持续代码修改能力的DeepSWE v1.1中,得分从46.2跃升至66.9;在处理多类别竞争、强调跨工具协作长程任务的Agents' Last Exam中,得分从23.8提高至28.5。
此外,GLM-5.3展现出亮眼的网络安全能力。在网络代码审查与漏洞挖掘任务中,其表现水平与Mythos 5相当;在渗透测试CyberGym中,GLM-5.3得分84.5%,高于GLM-5.2的77.2%。
值得注意的是,上述提升均来自训练。基于IndexShare、SAO以及持续演进的下一代Slime框架,智谱在与GLM-5.2完全相同的底座上推进强化学习,目前尚未开发出该底座的智能上限。智谱将在两周后开放模型权重。
热门跟贴