打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

近日,一个名为Ox Alpha的匿名新模型,在海外主流大模型测试验证平台OpenRouter和OpenCode发布后迅速走红。上线首日即冲至全球大模型聚合及路由平台OpenRouter榜首,并刷新单日词元用量历史纪录,相较之前最大词元量提升4倍。

打开网易新闻 查看精彩图片

OpenRouter公布的最新数据显示,在截至8月24日的一周内,Ox Alpha占据平台19%的词元用量。同时,在全球高热度编码代理平台OpenCode,Ox Alpha一上线即终结了前款模型连续56天的霸榜,成为全球开发者集中使用的新晋模型。

打开网易新闻 查看精彩图片

对于这款在海外双平台创下历史纪录的模型,网友引用近来火爆的电影《牛来》称之为“牛来”模型,最终被海淀大模型企业智谱认领。8月26日,智谱上线并开源GLM-5.3-Flash模型,这是GLM-5系列的首个原生多模态模型。记者发现,GLM-5.3-Flash使出的大招,是建立在国产算力卡上,这也是国产卡首次大规模集体“出海练兵”。

打开网易新闻 查看精彩图片

调用量创下双平台新高

打开网易新闻 查看精彩图片

GLM-5.3-Flash模型总参数为320B,支持100万词元上下文,擅长编程和智能体。这款模型能力超过GLM-5.2,在全球权威的AA综合智能指数中取得57分,与美国人工智能企业Anthropic最受欢迎的模型Claude Opus 4.8得分持平,进入全球前沿模型能力区间。

打开网易新闻 查看精彩图片

在各项基准测试和实际使用中,GLM-5.3-Flash全面超越参数量高出一倍的GLM-5.2。智谱表示,GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当,但激活参数量与层数几乎减半。结合智谱最新的30T词元多模态预训练语料,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。

GLM-5.3-Flash同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本,并采用流形约束超连接提升模型规模扩展能力。

打开网易新闻 查看精彩图片

据了解,GLM-5.3-Flash是GLM-5系列首个原生多模态模型。视觉能力被原生集成进模型中,使其能够自主判断何时需要“观察”,并利用视觉反馈来指导下一步行动。对于前端开发、游戏开发、3D仿真等任务而言,最终产物包括用户能够感知的界面、交互或虚拟世界。在没有任何外部素材的情况下,GLM-5.3-Flash自主运行16个小时搭建了一套约400平方米的专业主厨住宅与测试厨房。

打开网易新闻 查看精彩图片

“牛来”模型跑在国产芯片上

打开网易新闻 查看精彩图片

为广泛收集用户的反馈,GLM-5.3-Flash在正式发布前,以匿名模型Ox-Alpha的形式,在OpenCode和OpenRouter两大海外平台进行了大规模测试,迅速成为当周最受欢迎的模型,词元调用量高达62T,创下双平台调用量新高。

打开网易新闻 查看精彩图片

记者了解到,GLM-5.3-Flash全部线上流量由10万张国产芯片承载,这是智谱首次在大规模流量中尝试用大国产芯片集群提供服务,直接服务全球真实负载。在国产算力芯片首次大规模集体“出海远征”中,为克服单张芯片算力与内存容量相对有限的问题,智谱将这些芯片通过自研高带宽互联网络连接。在开源推理引擎SGLang基础上构建了专用的推理引擎。整个构建工作由GLM-5.3驱动的基础设施智能体大大加速,协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成了“模型优化系统,系统承载模型”的正向循环。

打开网易新闻 查看精彩图片

在国产算力跑的GLM-5.3-Flash模型,吃下OpenRouter近五分之一的词元用量,承接起全球主流平台上真实、高并发的业务流量,不仅是一次面向全球开发者的规模化验证,也意味着国产芯片正进入全球大模型服务链条,在真实市场需求中接受检验。GLM-5.3-Flash上线即开源,所有国产算力芯片都可以运行这一前沿模型,对开源生态和国产芯片的发展具有里程碑意义。

打开网易新闻 查看精彩图片

前沿模型进入普惠时代

打开网易新闻 查看精彩图片

GLM-5.3-Flash进入全球前沿模型能力区间,全面超越参数量高出一倍的GLM-5.2,编程表现与Claude Opus 4.8相当,目前定价却仅为GLM-5.2的1/10,Claude Opus 4.8的1/40。

打开网易新闻 查看精彩图片

智谱表示,与同一硬件上的初始基线相比,GLM-5.3-Flash端到端服务性能提升了3倍,硬件效率和单词元成本已达到与主流英伟达GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。

当一款能力对标海外闭源旗舰模型的开源模型,把价格压至后者的1/40,标志着国产前沿模型正在进入普惠时代。

记者:倪恒虎

编辑:关镓萍

推荐 · 阅读