8月26日晚间,智谱正式上线并开源轻量旗舰多模态模型GLM-5.3-Flash。这款模型正是此前一周在海外开发者社区引发热议的匿名模型Ox Alpha,中文社区将其戏称为“牛来”。

这场“身份猜谜”始于8月20日。当晚,Ox Alpha以“隐身模型”身份悄然登陆全球头部AI模型聚合平台OpenRouter,发布方显示为匿名第三方。该模型配置了100万token上下文窗口,支持文本、图像与视频多模态输入,且在预览期完全免费使用。

上线首日,Ox Alpha调用量即登顶OpenRouter并刷新单日模型用量历史纪录。在OpenCode平台,它终结了DeepSeek连续56天的榜首纪录。OpenRouter公开数据显示,Ox Alpha登顶后,全平台调用量前五的席位已全部被中国大模型占据。

随着模型展现出突出的SWE编程评测得分和长文本推理能力,外界关于其开发者身份的猜测不断发酵。开发者通过分词器指纹特征、视频编码器token消耗、底层报错码等多重技术线索,将嫌疑指向了智谱的GLM系列。

8月26日,智谱正式确认Ox Alpha即为其最新发布的GLM-5.3-Flash。模型代号Ox在英文中意为“牛”,恰逢国内热门电影《牛来》走红,中文社区便以“牛来大模型”称呼。

据智谱官方披露,GLM-5.3-Flash是GLM-5系列首个原生多模态模型,总参数320B,激活参数18B。该模型采用稀疏注意力与线性注意力混合架构,以MIT协议面向全球开源,已上线Hugging Face。

比模型本身更受关注的是其算力底座,智谱披露,“牛来”测试期间的全部线上流量以及发布后的线上服务,均由10万张国产芯片承载。测试期间累计处理请求流量高达62T Token。

智谱在技术文档中表示,调用超过10万张国产芯片集群用于该模型推理服务,“硬件效率及单token成本已经达到了与主流英伟达GPU相当的水平”。

据《晚点LatePost》了解,这批芯片的供应商或来自华为、摩尔线程与海光,智谱官方对此未予置评。半导体研究机构SemiAnalysis评论称,这是国产算力芯片首次大规模直接服务全球真实负载。

在性能与定价方面,国际评测机构Artificial Analysis发布的综合智能指数中,GLM-5.3-Flash获得57分,与Anthropic旗下Claude Opus 4.8持平。

而在实际调用价格上,该模型国内官方API标准定价为每百万token输入0.8元、输出2.8元,仅为Claude Opus 4.8的四十分之一。

8月27日,智谱港股收涨12.62%,报1160港元,市值重返5000亿港元。

打开网易新闻 查看精彩图片