大模型推理成本能不能打下来?云天励飞给出了一个明确的时间节点。

7月18日,在2026世界人工智能大会上,云天励飞公布了未来两年的AI推理芯片路线图。三款芯片对应着推理过程中的不同计算环节,目标是推动算力成本走向“百亿Token一分钱”。

打开网易新闻 查看精彩图片

这个数字意味着什么?简单说,如果今天一个中等规模的AI应用每天消耗10亿Token,按照这个目标算下来,单日推理成本将被压缩到一毛钱。对大模型走向规模化部署而言,成本这条坎儿不再是天堑。

把推理拆成三道工序,三款芯片各管一摊

大模型推理看着是AI在说话,背后的计算过程其实可以拆成几个阶段。Prefill阶段要一口气处理你输入的整段话,对算力要求高;Decode阶段逐字往外蹦答案,对内存带宽更敏感;而在MoE这类模型架构里,Decode内部的FFN环节又是另一套计算特征。

云天励飞的思路是把这三道工序分开伺候。DeepVerse100P、DeepVerse100D、DeepVerse100L分别对应Prefill、Decode和Decode FFN环节。

DeepVerse100P瞄准的是百万级上下文的Prefill场景。传统混部架构里,长上下文Prefill和Decode抢同一套算力和带宽资源,往往挤占Decode的生成吞吐。单独配一颗P芯片专门管Prefill,相当于给长文本理解开了专用通道。

DeepVerse100D则专攻Decode环节,内存带宽对标主流芯片有数倍提升,支持1024卡Scale-up和光互联系统架构。按需建立光路直连,根据任务动态重构光路,减少传统多跳电交换里的排队、拥塞和中间转发开销,逐Token输出的稳定性直接受益。

DeepVerse100L锁定的目标更细,针对Decode阶段计算密集型的FFN。采用3D Memory架构,相比主流HBM大幅提升内存带宽,低延迟芯片互联配合激活数据快速传输,把计算和通信的并行效率往上拉。

单卡性能卷不动了,开始卷集群效率

三款芯片各自优化当然重要,但云天励飞的打算不止于此。

当AI推理部署到万卡规模,问题不再是单颗芯片跑得快不快。Prefill和Decode、Attention和FFN共用同一套通用算力,资源竞争不可避免。集群越大,通信阻塞、资源等待和尾延迟越容易吃掉整体效率。

按照云天励飞的方案,三款芯片将在万卡异构集群里分离式部署。不同推理阶段的负载分配到对应的芯片和资源池,通过高速互联协同运行。计算、访存、通信资源按实际需求配置,减少不同负载之间的资源干扰。

从面向特定推理负载做芯片优化,到多芯协同,再到万卡集群应用,云天励飞把推理芯片优化的边界从单颗性能推到了集群级效率。“百亿Token一分钱”的长期目标,依托的正是这套“推理工厂”逻辑——芯片、互联、软件和系统协同优化,持续拉低单位Token成本。

硬件之外还有一道坎:软件栈

硬件异构程度越来越高,集群规模越来越大,软件能不能跟上是另一回事。模型适配能不能快速完成、算子性能能不能充分释放、不同硬件资源能不能高效协同,直接决定DeepVerse芯片在万卡集群里实际跑出来的效率。

围绕三款芯片及集群应用,云天励飞在持续建设IFWA软件栈,覆盖AI模型开发、编程和系统层级。兼容性上,IFWA围绕Transformer主流架构完善PyTorch ATen算子适配和性能优化,加强对vLLM、SGLang等主流推理框架的支持,降低模型向DeepVerse平台迁移部署的成本。

模型适配和开发效率这边,IFWA搭了一套覆盖量化、压缩、编译和部署的自动化工具链,还引入了AI Agent参与推理芯片适配和性能优化。此前云天励飞已开源Houmao多Agent异构编程框架,不同Agent协同完成模型开发、算子开发、性能优化和测试验证,把部分依赖人工经验的芯片软件开发流程转为自动执行和持续优化。

此外,成熟的Triton算子能力被融入FlagOS,通过代码贡献、联合验证和社区复用,推动相关能力在国产AI软件生态中共享,减少不同硬件平台在算子适配上的重复投入。

IFWA不是封闭体系,目标是兼容主流模型、框架和开发工具,缩短模型在DeepVerse平台上的部署周期,让国产算力更快进入实际应用场景。

拉上30余家单位,搞了一个“1001计划”

芯片架构、IP与EDA、封装测试、系统互联、软件栈、算力平台,再到模型和应用——产业链上哪个环节掉链子,最终的Token生成成本都会受影响。

今年5月,云天励飞联合30余家单位共同签署“1001计划”倡议,围绕Token生成效率和成本,推动产业链上下游加强协同。逻辑很直接:模型和应用的需求更早反馈到芯片及系统设计环节,成熟的软件能力加快复用,芯片在集群和实际场景中的验证和应用也能提速。

随着AI走向规模化应用,算力竞争正从单纯的峰值性能转向对系统效率和单位Token成本的持续优化。芯片、软件、系统和应用之间的协同程度,越来越直接地影响AI算力的实际价值。

云天励飞的路径已经画清楚:以三款芯片为核心,构建一套服务于大规模Token生成的“推理工厂”,通过芯片、互联、软件和产业生态的协同创新,推动国产AI算力从“能用”走向“好用、易用、用得起”。百亿Token一分钱,不再是一个口号,而是一张有了执行节奏的路线图。