一款不靠英伟达、跑在十万张国产芯片上的模型,正在重新定义推理效率的竞争规则。

打开网易新闻 查看精彩图片

2026年9月,智谱AI正式上线GLM-5.3-FlashX。它的基础模型GLM-5.3-Flash此前以匿名身份“Ox Alpha”在海外开发者社区横扫OpenRouter热榜,6天Token调用量超过62万亿。FlashX的到来,则将这把火从“能力”烧向了“速度”。

一、320B参数,18B激活:混合注意力架构的工程突破

GLM-5.3-FlashX的技术底子值得细看。总参数量320B,每个Token仅激活约18B参数,采用MoE架构。但真正让它区别于同代模型的是注意力机制的创新:它是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。

具体而言,线性注意力通过递归机制捕获局部依赖关系,稀疏注意力则借助轻量级索引器召回全局上下文。这套组合带来的效果是直接的:相比GLM-5.3,注意力计算量和KV缓存大小分别降低3.01倍和4.44倍。模型还引入了流形约束超连接来提升大规模训练效率,并基于约30T Token的多模态语料完成预训练。

架构优化的工程价值,最终体现在推理速度上:FlashX最高输出速度达到200 tokens/s,是GLM-5.3-Flash的5倍。在1M上下文窗口下仍能维持这一速度,意味着长文档分析、视频理解等场景的响应体验将发生质变。

二、十万张国产芯片:速度提升的基础设施底座

FlashX的速度不是靠模型“瘦身”换来的,而是建立在智谱“All-in-Infra”战略的算力底座之上。

自2026年初实施该战略以来,智谱将国产芯片纳入前沿模型的主力推理算力,目前已形成10万级国产芯片规模化推理能力,单位Token推理成本较年初下降80%。在GLM-5.3-Flash以“Ox Alpha”匿名上线期间,全部线上流量均由这批国产芯片集群承载。

更具标志性的是,智谱创始人唐杰披露的RSI实践显示:由GLM-5.3驱动的Infra Agent在超10万张纯国产芯片集群上,从零完成了生产级推理系统的搭建与优化,不到两周将端到端吞吐提升至初始基线的3倍,硬件利用效率与单Token成本达到主流NVIDIA GPU相当水平。

这意味着国产算力不仅在“能跑”层面完成验证,在“跑得高效”层面同样站住了脚。

三、MaaS爆发与IPO压力:FlashX的战略方位

理解FlashX的定位,需要放在智谱当前的战略坐标系中。

2026年上半年,智谱收入9.54亿元,同比增长399.7%;其中MaaS开放平台及API服务收入约8.25亿元,同比增长2736%,占总收入86.5%。MaaS平台Token调用量较年初增长超40倍,用户超740万。智谱已将年末年度经常性收入指引上调至30亿美元。

MaaS的高速放量,本质上是模型能力与推理效率“双曲线”共同作用的结果。GLM-5.3负责冲击能力上界,FlashX则负责把前沿智能的单位成本压到可规模化使用的阈值以下。

与此同时,智谱正处于IPO关键期。公司于2026年1月在港交所上市,成为“全球大模型第一股”,此后持续推进科创板上市计划,拟募资150亿元。上市筹备期间,公司经历了多轮组织调整,商业化部门产研中心曾被大幅精简,官方回应称调整涉及十余人,主要围绕MaaS战略转型展开。

FlashX的推出,正是这一转型的产物:从“卖模型”转向“卖推理效率”,用基础设施能力构建护城河。

四、ZCode风波之后:开源的信任价值正在重塑

谈及智谱当前的开源策略,无法回避ZCode事件。

9月中旬,智谱旗下AI编程工具ZCode被曝默认将用户工作区完整代码打包上传至云端,引发开发者社区强烈反弹。智谱随后完成整改、邀请中国信通院和绿盟科技进行第三方审计,并正式开源ZCode代码库,交由社区监督。

这场风波揭示了一个深层命题:在大模型时代,开源已经不仅是技术策略,更是信任基础设施。智谱在事件后迅速选择开源而非封锁,这一决策的方向值得肯定。但社区信任的修复需要持续性行动,而非一次性危机公关。

对于GLM-5.3-FlashX,开源期待因此更加迫切。目前,FlashX本身并未开放权重,仅以API形式提供服务。其基础模型GLM-5.3-Flash已以MIT许可证在Hugging Face开源,允许商用和自托管。这意味着技术底座是开放的,但速度优化的推理实现被保留在API层。

从商业逻辑看,这完全合理,FlashX的核心价值在于十万卡集群上的推理工程优化,而非模型权重本身。但从生态逻辑看,如果智谱希望构建真正意义上的“国产算力+开源模型”生态闭环,将推理优化方案的部分技术细节开源,将是对社区信任的有力回应。

五、值得被看见的优点

抛开争议,GLM-5.3-FlashX代表的工程方向值得行业重视。

其一,长上下文能力与效率的平衡。1M上下文窗口不再是参数堆砌的产物,而是通过混合注意力架构实现了计算效率的实质性优化。这为长视频理解、大型代码库分析、多轮Agent任务等场景提供了可落地的技术方案。

其二,原生多模态的视觉Coding能力。FlashX将视觉能力融入Coding循环,模型能主动观察界面渲染结果与交互反馈并持续改进,在代码、浏览器与图形界面之间协同完成任务。这一能力对于前端开发、自动化测试、低代码平台等场景具有直接的工程价值。

其三,RSI的早期实践。智谱披露的Infra Agent案例表明,模型已经开始参与自身推理系统的优化闭环,自主分析性能瓶颈、定位精度缺陷、修改底层代码并持续迭代。这是国内大模型厂商首次公开跑进生产环境的RSI案例,其长期意义可能远超单次模型发布。

GLM-5.3-FlashX不是一款“更强”的模型,它是一款“更快”的模型。但在大模型从实验室走向生产系统的过程中,“更快”往往比“更强”更难做到,也更有商业价值。

试问什么时候开源?

打开网易新闻 查看精彩图片