国产GPU正在迎来一场比“芯片能不能做出来”更重要的考试。
9月9日,在2026京东全球科技探索者大会上,京东云宣布拟建设十万卡全功能GPU集群,打造超大规模国产智算基础设施。按照双方披露的合作规划,该集群将以摩尔线程全功能GPU为算力底座,面向大模型训练、推理以及具身智能等核心场景,并向产业生态开放算力。
从规模上看,这是一个十万卡级项目。
但如果只把它理解成京东云“采购了一批国产GPU”,其实低估了这次合作的产业含义。
过去几年,国产GPU解决的是一个“从0到1”的问题:
中国企业能不能做出真正可用的GPU。
而今天开始解决的,是另一个难得多的问题:
国产GPU能不能进入头部互联网公司的核心AI基础设施,并支撑十万卡级生产系统。
两者之间,是从“芯片国产替代”到“AI基础设施国产化”的一次跨越。
一、十万卡,意味着国产GPU进入“系统战争”
AI大模型时代,GPU行业正在发生一个非常明显的变化:
竞争单位已经从一张卡,变成了一整个计算系统。
一张GPU性能再好,也无法独立完成今天的大模型训练。
真正的大模型需要数千、数万甚至十万张GPU协同工作。
当集群规模扩大之后,决定AI生产效率的不再只是单卡峰值算力,还包括高速互联、通信库、任务调度、故障恢复、编译器、软件框架以及长期运行稳定性。
所以,从一万卡走向十万卡,并不是简单地把服务器数量乘以十。
它实际上意味着整个AI基础设施复杂度发生数量级提升。
而摩尔线程此前已经完成了一个重要的前置验证。
基于MTT S5000构建的夸娥万卡级智算集群已经实现商业化部署。根据公司披露,其Dense大模型训练MFU达到60%,MoE模型达到40%,有效训练时长占比超过90%,训练线性扩展效率达到95%。
更关键的是,MTT S5000智算集群已经在北京、无锡、杭州等地完成部署交付。
这意味着摩尔线程不是直接从“单卡”跳到“十万卡”,而是已经经历了从单卡、千卡到万卡的工程化验证。
这也是京东云此次合作真正值得关注的背景。
十万卡项目最终考验的,已经不是“能不能设计GPU”,而是:
能不能把GPU变成稳定运行的AI基础设施。
二、比“十万卡”更重要的是,谁在用这些卡
判断国产GPU有没有真正进入商业化深水区,一个很重要的标准就是:
客户是谁。
京东云的价值,并不只是一个大型客户。
它本身就是国内头部云计算平台,同时背后拥有零售、物流、仓储、供应链、工业等大量真实AI应用场景。
附件披露,消息人士称该十万卡集群有望于2027年正式建成,并将服务京东零售、物流、仓储等核心业务,同时向上下游生态伙伴开放算力。
这就使这次合作和传统算力中心建设有了明显区别。
因为这里不仅有算力,还有真实工作负载。
京东拥有自己的模型、自己的数据、自己的供应链体系,以及大量物理世界场景。
对于一家GPU企业而言,这类客户的验证价值要高于单纯采购硬件。
因为它会持续倒逼GPU厂商解决一系列真正的生产问题:
不同模型能不能快速适配?
推理性价比能不能持续优化?
集群长时间运行是否稳定?
软件栈是不是足够成熟?
新产品升级时,能不能平滑迁移?
这才是GPU商业化真正困难的地方。
三、这不是卖GPU,而是在共建一座“AI工厂”
从双方目前公布的合作内容来看,这次合作也已经明显超出了传统的硬件采购。
按照附件披露的信息,双方将在训练、推理以及具身智能三个层面展开协同。
训练侧,将围绕芯片、云平台和模型训练进行全栈协同,推动京东JoyAI系列模型迭代;
推理侧,将进一步优化夸娥智算集群与京东xLLM推理平台;
具身智能侧,则希望打通从高质量数据生成、大模型训练、仿真到实际部署的完整链路。
从这个意义上说,京东建设的并不只是一座GPU集群。
它更接近一座真正的AI工厂。
过去的数据中心,主要生产的是计算资源。
而AI工厂生产的是Token、模型、智能体,最终再把这些数字世界的智能输出到真实业务。
这一点对于京东尤其重要。
京东天然拥有物流仓储、供应链机器人、工业自动化等大量物理AI场景。
如果说ChatGPT代表的是AI进入数字世界,那么下一轮AI真正巨大的产业机会,很可能来自AI进入物理世界。
也就是:
让AI从“能聊天”,进一步变成“能干活”。
而这恰好需要比传统大语言模型更复杂的计算能力。
四、为什么“全功能GPU”在物理AI时代值得重新理解
这也是摩尔线程这次合作中另一个容易被忽视的点。
摩尔线程一直强调的并不是单一AI加速器,而是全功能GPU。
基于自主MUSA架构,其GPU希望在同一计算底座上同时支持AI计算、图形渲染、物理仿真、科学计算以及多媒体处理,并覆盖FP8至FP64精度。
在纯大语言模型时代,这种“全功能”有时候并不容易体现价值。
因为LLM训练最核心的就是矩阵计算效率。
但是进入具身智能以后,问题会发生变化。
训练一台机器人,首先可能要生成三维环境;
然后进行物理仿真;
再训练视觉、语言和动作模型;
完成Sim2Real之后,最终还要在机器人本体部署推理模型。
也就是说,一套Physical AI系统实际上同时涉及:
AI计算 + 图形渲染 + 物理仿真 + 推理。
这正是全功能GPU试图解决的问题。
目前摩尔线程已经基于MT Lambda搭建具身智能仿真体系,并完成四足机器狗和两足人形机器人的Sim2Real真机验证。
当这一能力碰上京东物流、仓储、供应链等真实场景时,双方合作的想象空间就不再只是“训练一个大模型”。
而可能进一步延伸到机器人、智能仓储乃至整个物理世界AI系统。
五、国产GPU开始从“替代芯片”进入“核心基础设施”
国产GPU过去几年最常被讨论的逻辑,是“国产替代”。
但“国产替代”其实存在两个完全不同的阶段。
第一阶段,是:
把一张海外GPU换成一张国产GPU。
第二阶段,则是:
直接按照国产GPU来规划下一代AI基础设施。
后者的意义要大得多。
因为一旦客户决定建设十万卡级集群,意味着后续的软件生态、模型适配、集群管理甚至数据中心架构都会围绕这套算力体系展开。
这就不再是一笔简单的设备采购。
而是一项具有明显路径依赖的长期基础设施投资。
从这个角度看,京东云此次选择摩尔线程真正重要的地方,是国产GPU开始进入互联网大厂AI基础设施的架构层。
对于整个国产算力产业而言,这也是从:
“能不能用”
“敢不敢大规模用”
的一次跨越。
附件实际上也将这一点概括为国产GPU从“可用”走向“规模化商用”。
六、还有一个值得关注的变量:S6000
而十万卡集群还有一个容易被忽视的特点:
它不会是一个静态系统。
根据目前的规划节奏,十万卡AI工厂有望在2027年建成。这意味着项目建设和交付周期可能跨越多个GPU产品代际。
因此,未来到底由哪一代产品承担主要算力,也成为一个值得观察的问题。
一个颇有意思的细节是,近期业绩说明会上,有投资者直接询问:
“S6000在互联网行业受到欢迎,收获较多订单,业绩何时体现?”
摩尔线程并未对这一表述作否定式回应,而是表示:
“以具体公告为准。”
附件据此提出一个值得关注的判断:结合十万卡AI工厂2027年的建设节点,未来后续交付中是否会出现S5000之后的新一代产品,值得持续跟踪。
这里当然还不能直接得出“S6000已经进入京东采购名单”的结论。
具体型号、订单规模以及交付节奏,都仍然应该以公司正式公告为准。
但这至少揭示了十万卡项目另外一个重要特征:
它不仅验证摩尔线程现在的产品,也给未来GPU持续升级预留了空间。
而GPU本身就是一个高度依赖快速迭代的行业。
摩尔线程成立以来已经完成多代GPU架构更新,过去近六年累计研发投入接近59亿元,并已实现五颗芯片量产、五代GPU架构迭代。
对于十万卡级AI基础设施而言,真正理想的状态从来不是锁定某一颗芯片。
而是底层GPU架构、软件栈和集群能力能够不断迭代,同时保持整个算力平台平滑升级。
这一点的重要性,可能不亚于十万卡本身。
七、真正的大单,是进入互联网大厂未来五年的算力版图
所以回过头来看,“十万卡”到底意味着什么?
表面看,是一个规模惊人的GPU项目。
更深一层,它实际上同时验证了三件事情。
第一,验证摩尔线程是否具备从万卡进一步向十万卡扩展的系统工程能力。
第二,验证国产GPU能否真正进入互联网大厂核心业务,而不是停留在边缘测试环境。
第三,验证国产算力能否和模型、云平台、具身智能以及真实产业场景组成完整闭环。
这也是为什么从产业角度看,这次合作的价值不能只用“采购了多少张GPU”来衡量。
对于GPU公司而言,真正的大单从来不是一次卖出十万张卡。
而是:
进入一家头部互联网企业未来数年的AI基础设施体系。
一旦芯片、软件、模型、集群和业务场景形成协同,客户关系就不再只是一次性硬件采购。
它会越来越接近一个长期计算平台。
过去几年,中国GPU产业一直在证明:
国产GPU能不能做出来。
京东云与摩尔线程这次合作开始回答另一个问题:
国产GPU能不能真正被大规模用起来。
如果十万卡级项目最终按照规划落地,那么国产GPU距离真正意义上的“规模化生产可用”,无疑又迈出了一步。
而这可能才是此次合作最值得关注的产业信号。
热门跟贴