8 月 26 日,智谱正式上线并开源 GLM-5.3-Flash (320B-A18B),这是 GLM-5 系列的首个原生多模态模型。
该模型总参数 320B,能力超过 GLM-5.2,在全球权威的 Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 57 分,进入全球前沿模型能力区间。在自研 Z.ai Code Bench 体感评估中,其编程表现与 Claude Opus 4.8 相当。
定价方面,GLM-5.3-Flash 定价为:
输入价格:0.15 美元
输出价格:0.50 美元
命中缓存的输入价格:0.03 美元
相比之下,是GLM-5.3 的 1/10,限时折扣内为 GLM-5.3 的 1/20,仅为 Claude Opus 4.8 的 1/40。
在正式发布前,智谱以匿名模型 Ox-Alpha 在 OpenCode 和 OpenRouter 上进行了大规模测试,创下双平台调用量新高。在OpenRouter 平台,仅用时6天便处理了超过 20 万亿个 Token。
架构方面,GLM-5.3-Flash 专为极低成本设计,总参数量与 GLM-4.5 相当(355B vs 320B),但激活参数量从 32B 降至 18B、层数从 92 层降至 45 层,几乎减半。结合最新的 30T Token 多模态预训练语料,该模型能够以更少的计算资源实现更强的性能。它也是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,相较于 GLM-5.3,注意力计算量与 KV 缓存大小分别降低了 3.01 倍和 4.44 倍。
多模态能力方面,GLM-5.3-Flash 将视觉能力原生集成进模型中,可自主判断何时需要 "观察" 并利用视觉反馈指导下一步行动,适用于前端开发、游戏开发、3D 仿真等任务。
智谱首次在大规模流量中使用国产芯片集群提供服务,通过自研高带宽互联网络连接,并在 SGLang 基础上构建专用推理引擎。与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。
目前,GLM-5.3-Flash 已正式面向全球开源,接入 ZCode 等编码平台,纳入 GLM Coding Plan(每天限量发放 10,000 张体验卡),并同步开放 API 调用。
热门跟贴