国产算力上的万亿参数全流程训练
6月30日,美团正式发布新一代万亿参数大模型LongCat-2.0,并宣布对外开源。官方信息显示,这是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型,总参数1.6T,平均激活约48B,动态范围33B~56B。模型从零开始预训练,原生支持1M超长上下文。
LongCat团队对国产算力的探索始于2023年。三年来,团队从千卡起步,逐步攻克算子适配、通信优化、分布式稳定性等基础难题,最终在五万卡集群上完成万亿参数模型的全流程训练与推理。预训练数据规模超过30T tokens,覆盖中文、英文、多语言和代码等多类数据。
面对万卡级训练中的硬件故障、通信异常、显存压力与数值波动,团队从稳定性、正确性和效率三方面入手。稳定性上,通过卡间通信异常处理、弹性扩缩卡和自动故障恢复,将月均日故障率降低70%以上;正确性上,通过自研设计确定性算子、Bitwise一致性验证和参数检测保障训练结果可靠;效率上,通过流水线调度、显存优化和算子级控核,训练MFU提升1.5倍。最终实现稳态日吞吐超过1T tokens/day。
推理阶段的协同优化
在推理阶段,LongCat-2.0围绕模型、算子和框架进行协同优化。通过大规模专家并行聚合访存带宽,支撑万亿参数MoE模型的低延迟解码;将零计算专家机制融入专家并行通信流程,使路由到零专家的token真正避免不必要的传输与计算;并针对通信、Attention、GEMM等核心算子优化调度,结合提前下发与权重预取等框架机制,进一步降低推理链路中的等待开销。
从稳定训练到低延迟推理,LongCat-2.0验证了团队已具备在国产算力集群上进行大规模模型训练的能力。它不只是“能训出”万亿参数模型,还让万亿参数模型能够在真实任务中稳定运行。
围绕Agentic Coding的架构设计
LongCat-2.0的架构设计始终围绕一个核心目标:让模型在真实Agentic Coding任务中更高效、更稳定地完成代码理解、生成与执行。1M超长上下文让Agent看见整个项目。传统模型在处理超过100K上下文后就开始“遗忘”前面的内容,LongCat-2.0采用LongCat Sparse Attention(LSA)稀疏注意力机制,在处理长文本时不再“逐字逐句地看”,而是智能筛选关键信息,将计算量从平方级降至线性级。这使得模型在100万Token的超长上下文中,依然保持精准的信息定位与理解能力。
零计算专家与ScMoE让算力用在刀刃上。代码任务中不同token复杂度差异巨大——定义变量名和推导递归算法对算力的需求完全不同。LongCat-2.0通过零计算专家实现token级动态激活(33B~56B),简单token不消耗算力,复杂token自动获得更多计算资源。
MOPD多专家融合让一个模型同时擅长写代码、做推理、懂交互。LongCat-2.0通过MOPD架构融合Agent、Reasoning、Interaction三组专家能力——Agent Experts专攻工具调用与自主纠错,Reasoning Experts深耕数学与STEM推理,Interaction Experts优化指令遵循与交互体验。推理时由门控网络根据任务类型动态调度最擅长的专家,而非简单合并参数。
评测表现与真实工作场景
综合评测结果显示,LongCat-2.0在Code和General Agent场景表现优异。编程能力方面,在考察深层工程能力的SWE-bench Pro中获得59.5,领先Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)和Claude Opus 4.6(57.3);在SWE-bench Multilingual中取得77.3,与Claude Opus 4.6(77.8)保持在同一水位;在真实终端指令交互评测Terminal-Bench 2.1中取得70.8。
真实办公场景的复杂任务处理方面,LongCat-2.0在搜索智能体评测集RWSearch中获得78.8,在生产力场景评测集FORTE中获得73.2,在BrowseComp中获得79.9,均达到或接近前沿闭源模型水平。这证明了其在多步骤任务规划、复杂工具调用及长程检索执行上的高可靠性,能够较好契合企业级Agent的落地需求。
内测期间,团队面向真实工作场景征集了大量真实的用户任务需求。通过LongCat-2.0搭建的AI SQL Agent,业务人员可以直接用自然语言查询数据,模型自动完成全链路闭环——理解问题意图、规划查询步骤,并将数据结果转化为清晰的业务洞察。给LongCat-2.0一个旧版插件代码库和一份新版SDK文档,它能自行分析整体架构、梳理核心逻辑,再将整个插件重构为符合新API的实现——保留全部原有功能,修复潜在隐患,编译一次通过。
全球开发者调用情况
正式版发布前,LongCat-2.0预览版本已通过OpenRouter平台和longcat.ai面向全球开发者开放调用。截至目前,该模型已跻身OpenRouter全球大模型调用量前三,月调用量在Hermes、Claude Code和OpenClaw分列全球第一、第二和第三位,成为最受全球Agent开发者欢迎的模型之一。
热门跟贴