8月27日,智谱昨日晚正式发布并开源GLM-5.3-Flash(320B-A18B),确认它就是此前在OpenCode和OpenRouter匿名测试的Ox Alpha。新模型是GLM-5系列首个原生多模态模型,已同步开放API并接入ZCode、智谱清言和GLM Coding Plan。
GLM-5.3-Flash拥有3200亿总参数,每次推理激活180亿参数。智谱称,该模型在Artificial Analysis Intelligence Index中获得57分,与Claude Opus 4.8最高档得分持平;完整版GLM-5.3得分为60。Flash不是用来刷智谱能力上限的,重点在保住较强性能的同时把成本压下来。
在智谱自建的Z.ai Code Bench max effort测试中,GLM-5.3-Flash与Claude Opus 4.8分别获得29.0分和29.5分,差距在一分以内,接近但未追平。
价格更值得看。GLM-5.3-Flash的API标价约为每百万输入、输出Token 0.15美元和0.50美元,GLM-5.3分别为1.40美元和4.40美元,前者约为后者的九分之一;活动期价格约为十八分之一。智谱在发布稿中将两组比例概括为1/10和1/20。智谱另给出"Claude Opus 4.8的1/40"这一说法,对应的是完成同一任务的成本,而非Token价表的直接比价。
正式发布前,智谱把模型以Ox Alpha的匿名身份放到OpenCode和OpenRouter,免费接受真实调用。OpenCode 8月26日披露,该模型六天内处理了42万亿Token,位列其模型用量榜第一。该数字由OpenCode平台自行统计披露。OpenCode此前提到的"每天100万亿Token"指其准备的服务容量,与这里的六天累计调用量属于不同口径。
智谱表示,Ox Alpha在OpenCode和OpenRouter均创下平台调用量新高,相关请求全部由国产芯片集群提供算力。匿名测试既是看模型在真实编程和智能体任务中的表现,也是在压测服务系统能不能扛住长上下文带来的持续负载。
架构和部署
GLM-5.3-Flash采用线性注意力与稀疏注意力结合的混合方案,并引入流形约束超连接(mHC)。与GLM-4.5相比,其总参数从3550亿降至3200亿,激活参数从320亿降至180亿,层数从92层降至45层。
还有一组对照针对完整版GLM-5.3。智谱称,GLM-5.3-Flash的注意力计算量和KV缓存分别降低3.01倍和4.44倍。两组数据的比较对象不同:参数量、激活参数和层数对照GLM-4.5,注意力计算量和KV缓存对照GLM-5.3。
模型使用30万亿Token的多模态语料进行预训练,支持约100万Token上下文,可接收文本、图像和视频输入并输出文本。视觉能力可以接入编程智能体的工作循环模:型先看网页、图形界面、游戏或3D场景的实际渲染结果,再根据看到的反馈继续改代码。
部署方面,智谱基于SGLang搭建面向国产加速芯片的推理引擎,并采用编码、预填充和解码分离的EPD架构。公司称,经过内存、通信和缓存优化,服务性能较初始基线提升约3倍,单Token成本达到与主流英伟达GPU相当的水平。以上数据以智谱自测口径为准。
GLM-5.3-Flash目前已提供在线体验、API和开放权重。Ox Alpha也就此从一个匿名免费接口,变成智谱面向编程和智能体场景的正式低成本模型。(易句)
(本文由AI撰文,网易编辑负责校对)
热门跟贴