2.8万亿参数的大模型,究竟要怎么跑快?这个问题最近被海内外团队几乎同时交出了答卷。
被盯上的是全球最大参数量的开源模型——Kimi K3。它凭借2.8万亿总参数、104B激活参数,刷新了开源模型的性能上限。但普通的AI服务器难以承载这么大参数量的模型,Kimi官方推荐64卡甚至更大规模的AI服务器才能装得下。有业内人士表示,一般未经优化的超节点跑Kimi K3,初始性能可能仅在10 tokens/s左右。
面对同一道难题,国内外团队给出的解法出奇地一致。
两条路线,同一个思路
9月21日,浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,通过紧耦合128芯本土AI芯片,单机承载2.8万亿参数Kimi K3,Token生成时延首破5.85毫秒。
9月23日,海外TPU推理优化团队Inferact开源tpu-megakernels,用16颗谷歌TPU v7芯片把整个K3装进一个kernel(内核),配合DSpark投机解码,低并发Decode(解码)吞吐达到709 tokens/s。
一个用本土芯片做商业化超节点,一个用Google TPU做开源推理项目,指向了同一个技术思路:打破算子边界,把大模型推理的计算过程融合到极致。大模型推理的竞争,正从模型算法层,深入到系统软件、芯片互联和内存管理层。
万亿MoE为什么难跑
万亿参数大模型推理为什么慢?很多人以为是算力不够,而实际瓶颈更在于数据搬运和内存带宽。
据知名半导体行研机构SemiAnalysis分析,K3一次前向计算的HBM带宽需求约1.5TB,896个专家需要分布到多张芯片上,每次前向还会触发超过120次All-to-All通信。即便芯片具备强大算力,数据传输跟不上节奏,大量计算能力也会被白白闲置。
对于Decode(解码)阶段而言,问题尤其明显。每生成一个Token,模型都需要持续读取大量权重。vLLM、TensorRT-LLM等传统推理框架往往需要启动大量Kernel,每个Kernel完成自己的加载、计算和写回,然后再启动下一个Kernel。于是,计算之间出现了大量细小的“空泡”。这些碎片化空泡累积起来,就是实际速度与理论峰值之间的鸿沟。
既然kernel边界是浪费来源,那是否可以尝试消灭边界?
一个kernel装下整个模型
Inferact的思路是整个模型就是“一个kernel”。其megakernel方案使用Google Pallas,把K3的92个MoE层放进一个Pallas调用,在一个Kernel内部完成整个解码过程。当前层计算时,下一层权重就可以通过异步DMA提前从HBM搬运到片上VMEM。
这套打法成立的关键是TPU v7的架构特性。每个TensorCore自带64 MiB VMEM,数据进入VMEM后,其生命周期可以由程序显式控制。于是,Kernel作者可以主动安排哪些权重提前搬运,哪些激活继续驻留,哪些数据在使用结束后立即释放。换句话说,Inferact做的是把整个模型看成一个连续的数据流。
浪潮信息没有把整个模型彻底压成一个Kernel。团队把众多基础算子融合成超级算子,用系统级紧耦合架构榨取整体效率。针对K3推理特点,他们把KDA、Gated MLA、MoE中众多基础算子融合为计算与通信协同执行的大算子,算子数量降低10倍,模型推理性能提升3倍以上。
具体来看,第一步是把小算子“焊成”大算子,减少中间停靠。按片上存储容量划分数据块,让前一步的结果直接留在寄存器或片上缓存中供后一步使用,减少kernel launch次数,也避免中间结果反复写入和读取HBM。
第二步,把通信和计算融合,让数据传输和计算同步进行。超级算子按照Tile(数据块)组织流水线,通过异步搬运和多缓冲机制,让下一块数据预取、当前数据计算和上一块结果写回同时进行。跨芯片通信也按照Tile推进,把通信延迟尽可能藏到计算过程里。
前者把整个Decode过程放进一个megakernel,后者把大量细粒度算子融合成超级算子。它们共同指向的,是传统“一个Op(算子)对应一个Kernel”的计算方式正在松动。
用K3优化K3
超级算子能够减少推理过程中的数据搬运与等待,但其设计和优化本身也是一项复杂的工程。数据如何复用、计算与通信如何衔接、不同阶段如何形成流水,都需要结合具体模型和硬件条件进行设计与验证。这些工作需要大量人工投入。
能否让AI参与其中,提高超级算子的生成与优化效率?为此,浪潮信息在元脑SD200 Ultra适配Kimi K3的过程中引入“超级算子智能体”,让Kimi K3参与自身的推理优化。针对K3的推理特点,智能体生成通算融合、Tile级流水的超级算子,推动计算、通信与数据搬运协同执行。
浪潮信息首席AI战略官刘军在采访中打了个比方:过去大模型推理由数百个算子串联执行,如同绿皮火车途经数百个小站,反复启停装卸数据,整体效率低下;而超级算子就像一站直达的高铁,省去中间停靠开销。
刘军谈道,以往行业清楚这套模式的短板,但人工算子优化调度的工作量巨大。如今Agent带来解法,浪潮信息采用“用K3优化K3”的思路,依托超节点系统架构,由AI智能体自动生成超级算子,再经由模型校验迭代,性能较此前再度提升50%,形成循环加速。
模型已经不只是被优化的对象,也开始成为优化基础设施的工具。这可能会成为下一代推理优化的重要范式。
芯片一张牌,系统一张牌
Agent时代,Token消耗增长数百万倍。据Gartner 2026年3月报告,一个Agent工作流每任务消耗的Token量是标准聊天机器人的5到30倍;高盛预测,到2030年全球Token消耗量将较2026年增长24倍,达到每月约120000万亿Token。
需求侧爆发,算力供给如何接住?这里可以看到两个典型困境。
第一个是Kimi K3代表的“向上”。模型越来越大,推理能力越来越强,长上下文、复杂推理、多Agent协同越来越多,单机越来越难承载,算力系统需要不断突破模型能力上限。
第二个是DeepSeek代表的“向广”。当越来越多用户开始调用低成本模型,Token需求会迅速扩张。模型本身可能已经足够便宜,但如果算力供给跟不上,低价Token就很难持续。
浪潮信息的回答是Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算),两条线齐头并进。向上,SD200 Ultra用5.85ms/token、单用户170 tokens/s,让前沿模型跑得起、跑得快。向广,HC2000多元算力机组用DirectCom 2.0极速架构,Prefill、Decode、FFN按负载匹配多元芯片,同等投资Token产能提升10倍。
中国玩家的护城河在哪里?单看芯片,其与NVIDIA仍有差距,单卡算力、生态、工具链都有明显短板。但到了超节点层面,靠系统级创新可以追平甚至超越单卡更强但系统松散的方案。
以浪潮信息SD200 Ultra为例,其用3D Hyper Mesh架构紧耦合128芯本土AI芯片,提供8TB统一编址显存和64TB内存,通信时延低至0.69微秒。通过对称内存技术,首次在基于本土AI芯片的超节点上实现GPU显存直连,AllReduce通信时间降低3.5倍。
刘军谈道,超节点最基本的特征是显存要统一寻址,这一点做到了,才能把这么大的模型放进去,否则就只能叫节点集群,还是需要把模型拆分成若干段。
芯片是一张牌,系统工程则是另一张牌。当芯片之间能够形成更紧密的连接,内存能够形成统一空间,通信可以藏进计算过程,算子又可以由AI持续优化,单芯片性能之外的系统红利就开始释放。对于本土算力而言,这条路径尤其重要。
效率革命才刚刚开始
AI算力竞争,正从造出更快的芯片变为把现有芯片组织到极致。Inferact用16颗TPU证明一个kernel可以装下2.8万亿参数;浪潮信息用128颗本土芯片证明系统级紧耦合加超级算子,可以让本土算力跑进第一梯队。
两条路线,一个方向。大模型推理的效率革命,才刚刚开始。对中国AI产业,这个方向的特殊意义在于,在芯片工艺受限的约束下,系统级创新是确定性最高的追赶路径。
热门跟贴