新京报贝壳财经讯(记者罗亦丹)8月26日晚,智谱在官方公众号发文,官宣上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型。

值得注意的是,在正式发布前,智谱方面以匿名模型Ox-Alpha(中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试。Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高,且这些请求流量全部由国产芯片提供算力支持。

GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的1/10。这得益于其全新模型架构。GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当(355B vs. 320B),但激活参数量(32B → 18B)与层数(92 → 45)几乎减半。结合我们最新的30T Token多模态预训练语料,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。

智谱方面称,“过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。”“与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单Token成本已达到与主流英伟达GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。”

编辑 岳彩周

校对 杨许丽