【智谱发布GLM-5.3:不换基座只做后训练,多项基准拿下开源第一!】
8月14日,智谱正式发布新一代旗舰模型GLM-5.3。该模型继续沿用与GLM-5.2相同的7430亿参数MoE基座,全部性能提升来自后训练阶段的极致Scaling。智谱官方称其为“Built to Code与Ready for Cyber Defense”,定位编程与网络安全两大方向。 编程能力提升幅度显著。在智谱内部自建评测中,GLM-5.3较GLM-5.2提升约50%。公开基准方面,Terminal Bench 3.0得分从4.6跃升至28.3,拿下开源第一;DeepSWE v1.1从46.2升至66.9。更关键的是token效率:在High档位下,GLM-5.3以约5万输出token达到31.4%的任务完成率,超过Claude Opus 4.8最高档位的29.5%,而后者需要约12万token。不过相比Claude Fable 5的39.5%完成率仍有差距。 网络安全能力出现“涌现式”跃升,官方称部分能力超出最初预期。CyberGym白盒源码审计基准达84.5分,超过Anthropic Mythos 5的83.8分和OpenAI GPT-5.6 Sol的83.6分。ExploitBench从24.4翻倍至54.4。更实际的数据是:智谱联合安全团队在269个开源项目中发现2436个漏洞,其中1097个为中高危级别,最早可追溯至约40年前的代码。 发布节奏上,GLM-5.3将接入ZCode、Trae、WorkBuddy等平台,API随后上线,完整模型权重计划在两周后完成安全评估后开源。智谱联合创始人唐杰上午刚在X上回复网友“sooooooon”,中午模型就正式发布。 这一时间点恰好踩在竞争窗口上。DeepSeek于前一天刚宣布V4系列API调价,高峰时段输出价格最高达27元/百万tokens。若GLM-5.3维持与上代相近的定价,将在性能与价格双重维度对DeepSeek形成压力。
8月14日,智谱正式发布新一代旗舰模型GLM-5.3。该模型继续沿用与GLM-5.2相同的7430亿参数MoE基座,全部性能提升来自后训练阶段的极致Scaling。智谱官方称其为“Built to Code与Ready for Cyber Defense”,定位编程与网络安全两大方向。 编程能力提升幅度显著。在智谱内部自建评测中,GLM-5.3较GLM-5.2提升约50%。公开基准方面,Terminal Bench 3.0得分从4.6跃升至28.3,拿下开源第一;DeepSWE v1.1从46.2升至66.9。更关键的是token效率:在High档位下,GLM-5.3以约5万输出token达到31.4%的任务完成率,超过Claude Opus 4.8最高档位的29.5%,而后者需要约12万token。不过相比Claude Fable 5的39.5%完成率仍有差距。 网络安全能力出现“涌现式”跃升,官方称部分能力超出最初预期。CyberGym白盒源码审计基准达84.5分,超过Anthropic Mythos 5的83.8分和OpenAI GPT-5.6 Sol的83.6分。ExploitBench从24.4翻倍至54.4。更实际的数据是:智谱联合安全团队在269个开源项目中发现2436个漏洞,其中1097个为中高危级别,最早可追溯至约40年前的代码。 发布节奏上,GLM-5.3将接入ZCode、Trae、WorkBuddy等平台,API随后上线,完整模型权重计划在两周后完成安全评估后开源。智谱联合创始人唐杰上午刚在X上回复网友“sooooooon”,中午模型就正式发布。 这一时间点恰好踩在竞争窗口上。DeepSeek于前一天刚宣布V4系列API调价,高峰时段输出价格最高达27元/百万tokens。若GLM-5.3维持与上代相近的定价,将在性能与价格双重维度对DeepSeek形成压力。
