智谱今日正式发布开源模型GLM-5.3,定位相当直白:编程能力最强的开源模型。内部自建体感评测显示,与上一代GLM-5.2相比,编程能力提升50%,在Terminal Bench 3.0、Agents' Last Exam(CLI)等公开基准测试中均拿下开源第一。

这次发布有一个反直觉的细节:GLM-5.3的基座模型和GLM-5.2完全一致。智谱没有换基座,所有提升都发生在后训练环节。

打开网易新闻 查看精彩图片

基座没换,智能上界靠后训练顶上去

后训练Scaling是本代模型的核心叙事。智谱在完全相同基座上,通过强化学习把模型智能上界往上推了不少。具体做法包括:数十倍的长程任务环境、更丰富多样的环境类型,以及超长的后训练时间。

技术栈方面,依托IndexShare、SAO以及持续演进的新一代Slime框架,智谱在GLM-5.2同款基座上高效推进强化学习。智谱官方也有一个比较克制的判断:可能还远未开发出这个基座的智能上界。换句话说,这个基座还剩不少潜力没被榨干。

编程能力提升50%,多项基准分数翻倍

公开测试数据的提升幅度相当可观。在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3,翻了6倍还多。

其他基准同样涨势明显:

  • DeepSWE v1.1(长程软件工程与持续代码修改):得分从46.2升至66.9
  • Agents' Last Exam(跨工具协作与长程任务):得分从23.8升至28.5
  • GDPval-AA v2(覆盖44种职业的高价值知识工作):得分1,769,展现出基于编程能力涌现出的专业任务执行能力

少花一倍多的token,活干得更好

智谱自研的Z.ai Code Bench评估模型在真实编程场景中的综合体感。测试把模型放进复杂本地开发环境,在不同思考档位下执行端到端任务,模拟开发者实际使用Coding Agent的体验。

结果很有意思:High档位下,GLM-5.3准确率达到31.4%,超过Claude Opus 4.8最高档位的29.5%。更夸张的是token消耗——GLM-5.3每项任务平均输出约5万tokens,而Opus 4.8需要约12万tokens。准确率更高,执行路径还更短,这意味着效率优势在真实使用中会被进一步放大。

安全能力平行配置,权重两周后开源

除了编程能力,GLM-5.3在网络安全方向也有布局。在白盒代码审查与漏洞发现等安全任务中,其表现持平Mythos 5,面向网络安全防御场景有一定潜力。

开源节奏上,智谱将在发布两周后开放模型权重,此前需要完成安全评估与模型加固。官方解释是:尽可能限制模型的潜在攻击能力,同时保留其防御价值。

上线渠道与实用信息

即日起,GLM-5.3已上线智谱官方编程工具ZCode、效率工具AutoClaw,并面向GLM Coding Plan全量用户及开放订阅开放。TraeWork / TraeCode / 扣子、WorkBuddy / CodeBuddy、Qoder / QwenWork、CatPaw、JoyCode、OpenCode等编码平台同步开放抢先体验。API也很快上线。

一个对GLM Coding Plan用户有用的消息:今天13:00起全员额度重置,所有用户后台「用量统计」可见使用额度回满。想第一时间上手的朋友,可以去跑两轮真实任务试试成色。编程能力接近Claude Fable 5、体感超过其他国产模型——这个结论最终要靠开发者手里的键盘来验证。