美团本周直接把大招放了出来:万亿参数大模型 LongCat-2.0 正式开源。这不是一次普通的权重公开——HuggingFace、GitHub、ModelScope 三端同步上线,还附带了一套专门为国产算力芯片优化过的推理代码。

先说最硬的一个事实:LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型。总参数 1.6T,平均激活约 48B,主打真实 Agentic Coding(智能体编程)任务。这意味着,这套模型从架构到部署,都是奔着"在国产芯片上把活干完"去的,而不是只在顶级算力上跑个分。

打开网易新闻 查看精彩图片

这次开源值得关注的细节,拆成五个要点来看:

一、架构层面:稀疏注意力和 N-gram Embedding 是两张新牌

LongCat-2.0 引入了 LongCat 稀疏注意力机制(LSA),用流感知索引、跨层索引和层级化索引三项策略,专门处理智能体任务里的超长输入场景。目的是减少碎片化访存和重复索引计算,在保持模型质量的前提下加速百万级长上下文的训练与推理。

另一个关键设计是 N-gram Embedding。在 MoE 稀疏度已经接近 97% 的情况下,继续扩充专家带来的收益很有限,美团选择把 135B 参数投入 N-gram Embedding,作为新的参数扩展路径。这个模块占比控制在总参数 10% 以内,兼顾了收益和结构稳定性。

二、模型层优化:把显存和带宽的压力一点一点磨掉

国产芯片显存和带宽都受限,LongCat-2.0 在 Attention 上做了三件事:采用 absorb 计算模式、让 Indexer 与 MLA prolog 并行处理、通过 KVP 对 KV-cache(键值缓存)进行切分,把超长上下文带来的 I/O 与显存压力降下来。

ScMoE 这边则利用国产芯片的控核能力,让 Dense 和 MoE 分支实现物理核心级并行执行,直接压缩端到端延迟。最终效果是:百万上下文在国产芯片上也能高效推理。

三、芯片适配层:用 Super Kernel 和 Weight Prefetch 跟硬件死磕

算子太多启动开销就大,LongCat-2.0 用 Super Kernel 减少算子数量;I/O 等待浪费时间,就用 Weight Prefetch 把延迟隐藏在前序计算里。同时基于高速片间互联完成 layer-wise 的 KV-cache 传输,TP/SP/KVP 都在 scale-up 互联域内完成,在显存和带宽都有限的情况下把硬件利用率拉到最大。

四、部署策略:PD 分离,让 Prefill 和 Decode 各干各的

Prefill 端通过缩小 Expert-Parallel 域与序列并行,分担长序列计算压力;Decode 端用 KV-cache 切分和高并行度降低单卡显存占用。配合异步化的 Expert-Parallel Load Balancing,解决大 EP 度下的负载不均问题。

这些并行方案不是实验室里的摆设,已经适配了 constrained decoding、multi-step scheduling 和 MTP 等推理优化特性。换句话说,能在国产算力上稳定对外提供服务,而不是只能跑通一个 demo。

五、后训练和开源:模型会执行、会推理、懂交互,代码全部交出

后训练阶段,LongCat-2.0 采用多教师在线蒸馏,把专家拆成 Agent、推理和交互三类,分别聚焦自主执行、自适应推理和安全对齐,最后通过 MOPD 架构在国产算力集群上完成融合,让模型兼具深度推理、自主执行与精准交互的综合能力。

这次开源同步提供了 BF16、FP8、INT8 等多精度版本,并将针对国产算力极致优化的推理代码一并放了出来。也就是说,即便手上没有最新算力,也能基于现有硬件把 LongCat-2.0 跑起来。