金磊 发自 凹非寺
量子位 | 公众号 QbitAI

终于,这几天在网上炒得沸沸扬扬的神秘模型「牛来」(Ox Alpha),真身曝光了!

而且果然是来自中国玩家——

智谱刚刚发布即开源GLM-5.3 Flash,还是5系列里首个原生多模态的那种。

打开网易新闻 查看精彩图片

牛来」在火的这几天里啊,其实已经有不少人用Ox Alpha这个版本在实测了。

其中玩儿得比较多的,便是手搓一个SpaceX Raptor猛禽发动机3D交互网页

例如博主Tim Jayas时隔几日,用同样的Prompt让「牛来」做了两次这个任务后,直接发出了这样的感慨:

感觉「牛来」是一个能自己持续学习的模型。

打开网易新闻 查看精彩图片

巧了,我们刚好也拿到了GLM-5.3 Flash的内测资格,也做了同款的项目;在我们输入完Prompt之后,全程无需任何操作:

打开网易新闻 查看精彩图片

在等候片刻之后,3D猛禽引擎项目就出炉了,来感受一下这个feel:

打开网易新闻 查看精彩图片

视频地址:
https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

从效果对比来看,嗯,无需多言,GLM-5.3 Flash做出来的3D猛禽引擎,更精进了。

那为啥「牛来」模型会这么火?

单单是从各大官方的帖子中,我们就能窥知一二。

例如在OpenRouter上,「牛来」首日便冲上了榜首,还刷新了刷新单日tokens用量历史纪录:

打开网易新闻 查看精彩图片

OpenCode则表示,Ox Alpha一出世,即终结了DeepSeek在OpenCode连续56天霸榜的纪录:

打开网易新闻 查看精彩图片

而在智谱正式认领完「牛来」之后,我们还发现了GLM-5.3 Flash其它亮点。

模型尺寸方面,GLM-5.3 Flash仅为320B,但在能力上全面超越了体量为753B的GLM-5.2。

除此之外,根据最新的AA榜单显示,GLM-5.3 Flash已经拿下57分,放眼全球范围内已然是步入前沿之列,并且与Claude Opus 4.8得分持平。

打开网易新闻 查看精彩图片

价格方面,GLM-5.3 Flash的定价是5.3版本的1/10,限时折扣为1/20的GLM-5.3,1/40的Opus 4.8,定价低于DS-V4-Flash。

打开网易新闻 查看精彩图片

以及,还有一件值得骄傲的事儿——

上面提到的62T Tokens都跑在国产卡上!原来老外追了一个月的神秘模型,是头纯血国产牛。

那么接下来,老规矩,一波深度实测,走起~

智谱GLM,终于长眼睛了

正如我们刚才提到的,智谱GLM-5.3 Flash是5系列里的首个原生多模态模型。

所以第一波实测,我们就围绕多模态来展开。

例如我们给GLM-5.3 Flash一个多人说话的视频,让它能基于原视频,分清谁在说话,并且精准配上字幕。

Prompt如下:

先识别不同说话人,再制作兼具人物颜色和卡拉 OK 跟读效果的字幕:人物底色保持固定,当前读到的词或短语进一步高亮。配色使用青蓝、暖黄、珊瑚红和白色的高对比组合,当前词由低亮度平滑过渡到高亮色。区分主讲人、主持人和短暂插话者,背景音乐、掌声与环境人声不单列为说话人。字幕必须基于最终时间轴重新对齐,任何剪辑后的片段都不能沿用源视频的旧时间位置。先通览全片再做决定,避免只依据开头样本推断后续结构。请保持剪辑点自然,优先保证人声清晰。字幕放在画面安全区,并用描边或底板保证复杂背景下可读。

打开网易新闻 查看精彩图片

这个任务就挺考验一个模型多模态处理的功底,例如它得先对视频做理解,人物也得对应上,以及最重要的,字幕得精准。

那么我们来看一下GLM-5.3 Flash的表现:

打开网易新闻 查看精彩图片

视频地址:
https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

其中一个细节是,GLM-5.3 Flash可以先从画面里,捕捉到哪怕只出现了一次的“名签”这个细节,以此来对应声音、名字和人物的关系。

由此可见,GLM-5.3 Flash在这个任务上的多模态能力是比较过关的。

如果你觉得配字幕这个任务有点简单,那么接下来,我们再“喂”给GLM-5.3 Flash一整部经典电影《神话》,让它直接做一个电影解说视频

Prompt如下:

请将这部完整电影剪辑成一条中文电影解说视频,梳理主线剧情和人物关系,突出关键冲突与情绪转折,确保解说内容与原片一致,并生成配音和中文字幕。

来看下最终的成片:

打开网易新闻 查看精彩图片

视频地址:
https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

相比刚才的配字幕来说,GLM-5.3 Flash这次要“看”的视频时长更长,还要对整个剧情有把控,截取出来的关键片段且得是连贯和重要。

而从最终结果来看,GLM-5.3 Flash能自己理解并执行电影解说背后的一切关键步骤,并且效果呈现上,已然也是够达标的。

接下来,除了多模态之外,我们再把Coding能力放进来一起考验。

大致的任务是先给GLM-5.3 Flash一张完整的产品设计稿,让它基于一张图,做出来可以交互产品使用界面

准备的设计稿如下(上下滑动查看全图):

打开网易新闻 查看精彩图片

Prompt是这样的:

按照这张 UI 设计稿实现一个完整的移动端购物 App,尽量还原原设计里的配色、字体、图片、卡片和页面布局,并把图中展示的主要页面和购物流程做成可实际交互的版本。实现首页/发现、商品列表、筛选、商品详情、评价、收藏、购物车、配送、地址、支付、订单完成、门店地图、个人中心和设置等功能。

来看下最终互动的效果:

打开网易新闻 查看精彩图片

视频地址:
https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

依旧是一连串的功能都能按照Prompt的要求,丝滑地进行交互。

至于更加复杂的任务,智谱官方展示了一个由GLM-5.3 Flash独立跑了12个小时后的3D Blender场景构建任务的效果:

打开网易新闻 查看精彩图片

视频地址:
https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

嗯,现在GLM-5.3 Flash的情况就是,只要你给够它时间,它就能以低廉的价格,自己把复杂任务给跑通。

架构也是全新的

在看完实测后的结果,或许你会好奇一个问题:

为啥一个320B的模型,就能做到这样的效果呢?

答案其实藏在“Flash”这个词的背后。

这一次,智谱从模型架构本身就开始抠效率。

GLM-5.3 Flash总参数为320B,实际激活参数只有18B,层数也从GLM-4.5时期的92层压到了45层。但瘦身之后,能力反而超过了上一代更大的GLM-5.2。配合最新的30T Token多模态预训练语料,智谱希望做到的是少算一点,但别少干活。

打开网易新闻 查看精彩图片

这里面最关键的一刀,砍在了注意力机制上。GLM-5.3 Flash采用了线性注意力+稀疏注意力的混合架构

线性注意力负责抓住局部信息,稀疏注意力再通过一个轻量级索引器,把真正相关的全局上下文捞回来。面对1M这样超长的上下文,它不用让所有Token都彼此狠狠干一遍计算。

智谱还加了一个IndexPool,把索引器原本4个缓存向量压成1个。算下来,相比GLM-5.3,GLM-5.3 Flash的注意力计算量降低了3.01倍,KV Cache也缩小了4.44倍。

这也解释了前面实测里一个挺明显的感受,那就是它虽然顶着“Flash”的名字,但做起长任务来,并没有一股“轻量版”的味道。

尤其是这次终于长出来的这双眼睛。智谱专门为Visual Coding做了数据合成流水线,让模型在执行任务过程中,能够自己去看最终页面、交互和3D场景,再根据视觉反馈继续修改。

这也是为什么刚才设计稿还原、3D建模这类任务里,它能一边写、一边看、一边继续改。

除此之外,GLM-5.3 Flash目前承接这些线上真实请求的,背后跑的都是国产芯片。

为了在国产加速芯片上扛住多模态和1M上下文,智谱把多模态编码、Prompt预填充和逐Token解码拆成了可以独立调度、扩缩容的Encode-Prefill-Decode分离式架构,同时叠上Layer Split、混合缓存量化等一系列底层优化。

最终,相比同一套硬件上的初始基线,端到端服务性能提升了3倍,单Token成本也做到了与主流英伟达GPU相当的水平。

我国产、我开源,因为我够自信

这么一来,再回头看「牛来」这几天在海外突然爆火,味道其实就不太一样了。

在正式认领之前,OpenRouter和OpenCode上的海外开发者压根不知道Ox-Alpha是谁家的。大家就是觉得好用,然后一轮又一轮Prompt往里塞,硬生生把它用到了榜一。

结果等智谱把牌翻开,才发现还有后半截:

模型是国产的,连背后接住这波全球真实流量的算力,也是国产的。

正如我们上文提到的,Ox-Alpha匿名测试期间创下了OpenRouter、OpenCode双平台调用量新高,而这些请求全部由国产芯片提供算力支持。

这件事的意义,甚至不只在“国产模型又赢了一次”。过去前沿模型有个越来越现实的问题:能力越来越强,调用起来也越来越贵。

尤其Agent开始真正干活之后,一次任务跑几十分钟、几个小时,Token像开了水龙头一样往外流。模型再聪明,价格顶在那儿,很多任务依然会让人下意识算账。

GLM-5.3 Flash这次给出的答案就很简单。把架构、推理和算力效率继续往下抠,然后把前沿能力的价格一起打下来。

它在AA拿到57分,与Claude Opus 4.8持平;价格却只有后者的1/40。前沿模型终于开始有了点“日常消耗品”的意思。

最后还有开源。

GLM-5.3 Flash已经正式面向全球开源,同时接入ZCode、开放API。模型能跑在国产芯片上,权重又直接打开,开发者拿得到,企业也有机会自己部署。

模型、国产算力和开源生态,这一次算是真正接到了一起。

所以到这里,再看「牛来」这个名字,突然还挺贴切。

能干活,吃得少。而且这回,牛是自己的,草也是自己的。

BigModel开放平台:
https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash

Z.ai:
https://docs.z.ai/guides/vlm/glm-5.3-flash

GLM Coding Plan:
https://bigmodel.cn/glm-coding

Blog:
https://z.ai/blog/glm-5.3-flash

开源链接:
https://huggingface.co/zai-org/GLM-5.3-Flash
https://huggingface.co/zai-org/GLM-5.3-Flash-BF16