【导语】
一则来自彭博社的消息在国产AI产业链激起涟漪:DeepSeek计划在内蒙古部署至少16万颗华为昇腾950DT芯片,用于模型推理。若按规划落地,这将是目前已知规模最大的国产AI芯片集群之一,项目功率达到吉瓦级。消息背后,不仅是单一企业的算力采购决策,更折射出国产AI芯片从"可用"走向"堪用"、从单点验证走向规模商用的关键拐点。
一、事件还原:一份"超大规模"采购清单
据知情人士透露,DeepSeek此次部署的16万颗昇腾950DT芯片,仅是其内蒙古数据中心规划容量的一部分,整个项目功率达到吉瓦级,全部交付可能需要一年以上。
值得注意的是,DeepSeek与华为的合作不仅停留在芯片采购层面。双方围绕昇腾超节点展开联合定义,针对长文本推理场景,重点解决时延、吞吐与成本之间的三角难题,同时预留向万卡级集群扩展的能力。这意味着,从底层硬件到系统架构,这是一次深度协同,而非简单的"供货—采购"关系。
公开信息显示,昇腾950DT属于华为下一代昇腾950系列,定位偏向推理解码与训练场景。针对上述场景对数据读取和芯片间通信的高要求,该芯片规划配备144GB内存、4TB/s内存访问带宽和2TB/s互联带宽。与之同步推出的还有基于昇腾950DT打造的Atlas 950超节点,最多支持8192张昇卡,采用华为自研"灵衢"互联技术,使多台机器在物理上虽分散部署,在逻辑上却能像一台计算机一样协同完成学习、推理任务。
昇腾950DT及Atlas 950超节点的规划上市时间为今年第四季度。DeepSeek方面亦明确表态,受限于高端算力,其4-Pro API服务吞吐能力有限,待昇腾950超节点批量上市后,Pro版本价格将大幅下调。这一表态从需求侧印证了国产算力供给的紧迫性。
二、产业坐标:国产AI算力集群的"梯队跃迁"
将DeepSeek此次部署置于更宏观的产业图谱中观察,会发现这并非孤立事件,而是国产算力规模化部署浪潮中的标志性一笔。
回望近半年内的几个关键节点:今年3月,深圳投建的11000P智能算力集群正式点亮,叠加此前投运部分,合计建成14000P智能算力;6月,美团发布LongCat-2.0大模型,明确披露该模型已在五万卡国产算力集群上完成从零预训练到推理的全流程;7月,智谱被报道已建成一座规划功率约1吉瓦、采用国产芯片的数据中心,用于训练GLM系列模型。
从千卡到万卡,再到十万卡级;算力规模从百P级跃升至吉瓦级——国产AI算力的扩张速度正在刷新行业认知。DeepSeek此次规划的吉瓦级数据中心、16万颗昇腾950DT部署,正是这一趋势的阶段性高点。
更深层的意义在于,国产AI芯片正从"单点验证"迈向"规模商用"。早期国产算力部署多以中小规模试点为主,主要服务于模型微调、特定场景推理等任务。而此次DeepSeek与华为的合作,直接瞄准的是大模型推理这一高并发、高吞吐的核心场景,且明确以商业化API服务为目标导向。这意味着国产算力已具备承接生产级AI负载的技术底座。
三、技术深读:昇腾950DT与"超节点"架构的产业含义
从技术维度看,昇腾950DT的几组关键参数值得关注:144GB片内存容量、4TB/s内存访问带宽、2TB/s互联带宽——这三项指标共同指向大模型推理的"内存墙"问题。
大模型推理过程中,尤其是长文本、多轮对话等场景,单次推理需要频繁访问模型权重与KV缓存,对内存容量与带宽极为敏感。144GB的片内存意味着可以容纳更大规模的单卡模型或更长上下文窗口;4TB/s带宽则保证了数据搬运的效率;而2TB/s互联带宽则服务于多卡协同推理,是构建大集群算力的"神经系统"。
但单卡性能仅是基础,集群效率才是决定AI基础设施竞争力的核心变量。此次与昇腾950DT同步推出的Atlas 950超节点,正是华为给出的系统级解法。
"灵衢"互联技术的引入,使超节点在物理上由多台机器组成,在逻辑上却可被视作一台统一的计算资源池。这一架构思路与英伟达NVLink、AMD Infinity Fabric等国际主流互联方案在理念上趋同,但实现路径与拓扑细节各有不同。超节点最多支持8192张昇腾卡的扩展能力,使得从单集群到万卡级部署具备了工程上的可行性。
从产业视角看,这种"芯片+互联+超节点"的垂直整合能力,是国产AI算力走向规模化的关键门槛。单纯比拼单卡算力,国产芯片与国际旗舰产品仍有差距;但通过系统级创新弥补单点不足,国产算力正在走出自己的技术路线。
四、格局重塑:全球AI算力竞争的中国坐标
将视角拉至全球,DeepSeek与华为此次合作的意义远超单一交易本身。
过去两年,全球AI算力竞争高度集中于英伟达GPU生态。H100、H200、B200等产品在云端AI训练与推理市场占据主导地位,而高端AI芯片的出口管制更使全球算力供给格局趋于复杂。在此背景下,国产AI芯片的规模化部署不仅是商业选择,更是产业安全的战略考量。
DeepSeek选择昇腾950DT,本质上是在构建一条不依赖于境外高端芯片的算力供给链路。这种"模型—芯片"垂直协同的模式,正在成为中国AI产业的重要特征:头部大模型公司不再仅是算力使用者,而是深度参与到底层芯片的能力定义与场景调优之中。这种协同效率,是单纯的芯片销售关系所无法企及的。
从产业链上游看,16万颗芯片的订单将直接拉动国内先进封装、HBM内存、高速互联等环节的产能扩张与工艺迭代。国产AI芯片的规模商用,正在反向赋能国内半导体产业链的整体升级,形成"应用驱动—芯片需求—上游产能"的正向循环。
当然,需要客观看待的是,目前国产AI芯片在软件生态、开发者工具链、跨厂商兼容性等方面与国际成熟生态仍有差距。CUDA生态经过十余年积累形成的开发者粘性,是国产芯片需要长期补齐的功课。但随着DeepSeek、智谱、美团等头部模型厂商大规模采用国产算力,应用层与芯片层的协同优化将持续推进,软件生态短板有望在实战中逐步弥合。
五、趋势展望:国产算力进入"规模驱动"新阶段
展望未来,国产AI算力产业有望呈现以下几条主线:
第一,超节点架构成为集群标配。Atlas 950超节点等方案的推出,标志着国产算力正从"堆卡"走向"系统级设计"。未来围绕大模型训练与推理的系统级优化,将是国产芯片厂商竞争的核心战场。
第二,推理算力需求加速释放。DeepSeek在公告中明确提及,昇腾950超节点批量上市后将大幅下调Pro版本价格。这预示着随着推理成本下降,大模型API服务将进一步走向普惠,催生更广泛的行业应用,反过来又对推理算力规模提出更高要求——形成"成本下降—应用爆发—算力扩张"的飞轮效应。
第三,国产算力集群从"训练为主"向"推理为主"拓展。此次DeepSeek部署明确指向推理场景,而非训练。这与全球AI基础设施的发展趋势一致:当大模型预训练进入"巨头游戏"阶段后,推理侧的算力需求将成为更广泛的市场机会。国产芯片若能在推理场景中实现性价比突破,将打开远比训练市场更广阔的商业空间。
第四,"模型+芯片"垂直协同模式走向常态化。DeepSeek与华为的联合定义模式,很可能成为国产AI产业链的范本。未来,头部模型厂商与芯片厂商之间将形成更紧密的耦合关系,从芯片定义阶段就介入,共同面向具体业务场景做优化。
【结语】
16万颗昇腾950DT的采购计划,是国产AI算力产业的一次标志性事件。它既是中国AI产业链垂直整合能力的集中体现,也是国产半导体产业在外部约束下加速自主的缩影。当吉瓦级算力集群开始以"国产"为底色,中国在全球AI算力竞争格局中的坐标,正在被重新书写。
热门跟贴