智谱旗下神秘模型Ox Alpha正式现身,带动公司股价大幅走高,并以国产芯片全量承载海量推理流量的披露,在AI硬件领域引发广泛关注。

周四,智谱股价盘中涨超9%,报1124港元。消息面上,智谱8月26日正式确认,此前在开发者社区引发热议的匿名模型Ox Alpha——中文社区称"牛来",即为其最新发布的GLM-5.3-Flash(320B-A18B)。该模型在Artificial Analysis Intelligence综合智能指数中取得57分,与Anthropic的Claude Opus 4.8持平,高于DeepSeek旗舰模型V4 Pro正式版的53分。

打开网易新闻 查看精彩图片

在正式发布前,GLM-5.3-Flash以匿名形式在OpenRouter和OpenCode两个平台免费开放测试,5天内累计流量超过50万亿token,刷新两平台流量增长纪录,当前使用量已超过DeepSeek的两倍以上。智谱同时披露,上述全部流量均由国产芯片承载,调用超过10万张国产芯片集群用于推理服务,并称"硬件效率及单token成本已经达到了与主流英伟达GPU相当的水平"。

国产芯片全量承载,硬件叙事引发市场关注

智谱此次披露中,国产芯片的表现是市场关注的焦点之一。据智谱官方技术文档,公司调用超过10万张国产芯片组成集群,为GLM-5.3-Flash提供推理算力支持,并表示硬件效率与单token成本已可与英伟达GPU相媲美。

半导体研究机构SemiAnalysis随即在X平台发文评论称:"所有流量均由国产芯片承载,硬件效率和单token成本已可与英伟达GPU相媲美。继Jalapeño(OpenAI自研推理芯片)昨日宣布之后,CUDA护城河再度受到考验。"该机构还特别指出,此前业界普遍认为只有顶级前沿实验室才具备每日100万亿token的算力规模,"而这里每日100万亿token的免费流量,全部跑在国产芯片上。"

据《晚点LatePost》了解,这批芯片的供应商或来自华为、摩尔线程与海光。智谱官方对此未予置评,技术文档中亦未明确具体芯片型号。

为应对单张芯片内存容量与带宽的瓶颈,智谱在SGLang基础上构建了专用推理引擎,采用W8A8量化、INT8/FP8/BF16混合缓存量化及节点内张量并行等技术,并引入生产级Encode–Prefill–Decode(EPD)分离式架构。智谱称,与同一硬件上的初始基线相比,端到端服务性能提升了3倍。

架构重构:激活参数与层数近乎减半

GLM-5.3-Flash在架构层面与前代产品存在显著差异,这也是其能够以更低成本实现更高性能的核心原因。

与GLM-4.5相比,GLM-5.3-Flash总参数量相近(355B对比320B),但激活参数量从32B降至18B,层数从92层减至45层,几乎减半。参数量约为上一代旗舰GLM-5.3的40%,与DeepSeek V4 Flash几乎持平。

智谱称,GLM-5.3-Flash是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,相较于GLM-5.3,其注意力计算量与KV缓存大小分别降低了3.01倍和4.44倍。此外,该模型也是GLM-5系列首个原生多模态模型,支持图像和视频输入,同时是智谱战略聚焦coding以来首次推出具备多模态能力的新模型。

定价策略:瞄准涨价潮后的需求缺口

GLM-5.3-Flash的发布,恰逢中国AI模型市场一轮集体涨价之后。Kimi K3输出价格高达每百万token 100元,超过前代K2.6三倍以上;DeepSeek V4 Pro从6元涨至13.5元,高峰时段达27元;DeepSeek V4 Flash输出价格从2元涨至4.5元,高峰时段9元。

据《晚点LatePost》,DeepSeek V4 Flash提价后,在OpenCode平台上的调用量下滑了一半,这部分外溢需求成为国产模型厂商新的增长空间。

GLM-5.3-Flash的定价策略正是瞄准这一缺口。该模型每百万token输入0.8元,输出2.8元,缓存命中价格0.23元,为GLM-5.3的十分之一,上线前两周实行半价。智谱表示,限时折扣期内定价为GLM-5.3的1/20,为Claude Opus 4.8的1/40。与调价后的DeepSeek V4 Flash相比,GLM-5.3-Flash在绝大多数常规调用场景下更为便宜。

智谱计划于下周一发布首份详细财报,覆盖今年1月上市以来的前六个月业绩。此次GLM-5.3-Flash的发布及其市场表现,将为投资者提供评估公司商业化进展的重要参照。