9月30日这天,DeepSeek在自家GitHub账号上,开源了一整组面向华为昇腾芯片的基础设施组件,一共六个。

核心的三个是TileLang、DeepGEMM、DeepEP,每一个都能在英伟达那套软件栈里找到对位,这一次却专门为华为昇腾芯片而生;同批发布的还有TileKernels、FlashMLA、DeepSelect三个组件。

不少自媒体把标题写成“对标CUDA”,可真点进仓库读一遍,会发现它干的事比标题要实在得多。

一组六个组件,一条从英伟达搬过来的训练链

9月30日,DeepSeek在GitHub上新开源的这组组件,全部锚定华为昇腾平台。据36氪、腾讯新闻当天报道,它们与DeepSeek此前在英伟达硬件上放出的同类开源项目形成对位关系。

打个比方理解这件事:这就像一款在Windows上跑得很顺的桌面软件,被人原封不动移植到Linux上。应用软件本身没换,跑的还是那套业务逻辑,只是底下调度硬件的指令层换了另一种语言。

打开网易新闻 查看精彩图片

核心三件套各自管一段。据财联社、OSCHINA同日报道,TileLang是一门高级编程语言,目的是让写高性能算子这件事没那么费劲——它先在英伟达卡上跑通验证,再把昇腾的指令封装进同一套接口。

DeepGEMM Ascend负责矩阵乘法那一层,DeepEP Ascend负责多张卡之间的集合通信,对应到英伟达生态里,就是GEMM库和NCCL通信库这两个位置。同批开源的另外三个组件也各有分工:

TileKernels装着一批常用算子,FlashMLA管稀疏注意力,DeepSelect负责TopK数据筛选。

换成大白话:矩阵计算是大模型做大规模数值运算时最底层的那道工序;集合通信是上百张卡一起训练时,彼此递数据、对答案的那条线;TileLang则是给写这些工序的工程师准备的一支顺手的笔。三件事加在一起,

正好凑齐训练一个大模型绕不开的底层环节。

同一份公告还带出另一条进展。据36氪披露,DeepSeek与华为联合调优的一套昇腾950、共128张卡的集群方案,已经走完验证流程;这一数据目前只有单一来源,尚未见到第二方交叉确认。

更关键的细节藏在工具链的实际用途里。据DeepSeek自己披露,TileLang已经承担起DeepSeek-V4训练过程中大部分算子的实现工作;这一点同样是单源信息,外部还没有独立的复现报告。

把这些信息拼起来看,DeepSeek不是凭空新写,而是搬旧栈——把自己已经在英伟达卡上验证过、并且正在用的训练工具,一层一层搬到了国产硬件上。

它真的不是“中国版CUDA”

自媒体把这件事喊成“对标CUDA”,但只要把反方意见摆到桌面上,就会发现这个标题撑得太大。CUDA从2007年问世到现在,攒了十几年的家底:底下是驱动,往上是一整套数学库、通信库,再往上是编译器和开发工具,

最上面还压着一个庞大的开发者社区。

新开的这组组件,填不满这一整层栈。

这个反驳是站得住的。昇腾这边的开发者基数、文档完善程度、第三方模型的适配广度,跟CUDA比都还有肉眼可见的距离。一个刚起步的芯片平台,不是开源几个核心库就能瞬间补齐生态的。

打开网易新闻 查看精彩图片

把话说回来:DeepSeek自己从头到尾没有讲过“做一个中国版CUDA”。真正发生的事,是这家公司把自己内部已经跑顺的那套训练软件,连代码带接口一起,搬到了昇腾上。把标题撑大的,是围观者“又双叒搞大事”的那股兴奋劲。

公告细节里也留着“还没做完”的痕迹。据36氪逐字梳理这份开源说明,DeepEP的昇腾分支里,依然挂着若干标注为开发中的功能;同时DeepSeek没有对外公布V4已经在昇腾集群上跑完一整个大规模训练流程。这两点合在一起,

就是“它还不是CUDA”最硬的注脚。

这件事依然值得做,原因藏在算力分配里。据The Information报道、36氪转引的口径,DeepSeek把超过70%的算力投在了模型训练上,留给推理的不到三成。

训练这一侧的算力盘子越大,手里多握一条硬件路线,多一条硬件路线就多一分筹码。

做模型做到头部的公司,这一回亲自上手给国产芯片写训练用的底层栈,这件事本身的分量,比任何一份产业扶持文件都更能撬动周边生态跟着迁移。国产芯片从“能点亮”到“真能用来训模型”的那一步,过去喊了很多年,

这回是国内头部大模型厂商一行代码一行代码蹚出来的。

不过也要把边界划清楚:从这几个开源组件,到一个完整的开发者生态,中间还隔着文档、教程、第三方框架适配、问题响应速度一长串硬功夫。

生态迁移的驱动方式变了

表面看,这只是一次普通的开源发版。往深一层看,它更像是一个信号:中国AI领域的软硬件协同,正在从发文件、喊口号的阶段,迈入靠工程实践一点点落地的阶段。

最有力的反方意见也得听进去。DeepSeek把自己内部用顺手的工具开源出来,不等于昇腾生态就此成熟;外面的开发者社区会不会真的跟进、跟多久,要交给时间检验。另一个提醒同样刺耳:

中美之间的芯片硬件差距并没有因为这组组件消失,这一步缩小的是软件生态那一段,不是把硬件本身追平,现在就宣布胜利为时尚早。

真正值钱的地方在于参照系。一家走在前面的模型厂商,把自家训练用的核心栈搬到国产芯片上,又把代码全部摊开在明面上,其他想做同样选择的团队,手里就有一份可以直接对照、直接复用的工程样本。以前要从头踩坑,

现在至少有了一条被趟过一遍的路。

对国产芯片来说,这一步的定位要拿准:它是从“能用”往“好用”迈的一格,远不是终局。

发版之后的社区反应,也能侧面说明问题。据OSCHINA记录,仓库上线24小时内,星标数涨得很快;而issue区冒出来的第一条提问,问的是“什么时候支持昇腾910C”。开发者真正关心的,不是发布会里讲了什么,

而是下一个型号什么时候能用起来。

这条提问本身就是风向标:社区已经不纠结“要不要迁过来”,而是在追问“下一颗芯片什么时候跟上”。当一套被头部公司自己验证过的代码摊开在那里,后来者省去的是从零摸索的时间,多出来的是一份可以照着改、照着跑的参照。

生态迁移的节奏,从此前靠政策文件去推,慢慢换成了靠工程范例牵引。