俗话说得好,教会徒弟饿死师傅,做生意从来都是把核心饭碗死死捂住。
年化收入冲过十亿美元、估值奔向五千亿的DeepSeek,不仅没把自研的算力代码锁进柜子,反而拉上华为,把底层算力基础设施全免费开源给了全球同行。
英伟达靠CUDA筑了整整二十年的算力高墙,难道要被这套不按常理出牌的操作撬开一道口子?
以为英伟达赢在硬件,其实全球同行都被困在代码规则里
很多人聊起算力竞争,总习惯盯着显卡芯片上的晶体管数量和浮点运算数字看,以为只要其他厂商造出参数相仿的芯片,就能把英伟达换掉。
但现实很残酷,过去几年全球人工智能加速计算市场里,英伟达的市场份额常年维持在百分之八十以上。
之所以出现这种一家独大的局面,根源在软件生态的深度锁定。
早在2004年,斯坦福大学的研究人员就开始尝试用图形处理器处理通用并行计算任务。到了2006年,英伟达敏锐捕捉到了这个方向,把相关研发人员招入麾下并推出了统一计算架构CUDA。
为了把这套软件推开,英伟达在连续数年时间里,要求出厂的每一张显卡都必须在硬件层支持CUDA,直接拉高了制造成本,导致公司利润大幅下滑、股价跌去七成。
但英伟达硬是连续多年持续注资,最终在2012年深度学习浪潮爆发时拿到了回报。
英伟达的做法,是在硬件和应用之间做了一层专有的并行线程执行虚拟指令集。全球数百万程序员在十几年里写出来的算法、模型架构和底层加速库,全部调取英伟达的专属接口运行。
这就让后来追赶的芯片厂商吃尽了苦头。
其他厂商就算把硬件造出来,客户也根本不敢换,因为一旦换掉硬件,开发者过去十几年写好的几十万行底层代码就得全部作废重新写。
为了解决代码不通的问题,此前许多非英伟达厂商普遍选择了软件转译的应对方案。也就是在自己的芯片上开发一套转换层,把开发者的CUDA指令动态转成自己的硬件指令。
但从实际工程数据来看,这条路很难走通。
首先是严重的效率折损。不同芯片的内部寄存器架构、显存读写逻辑完全不同,跨平台的代码转换通常会导致百分之三十到百分之五十的硬件计算能力白白浪费在调度环节中。
其次是技术规则完全受制于人。英伟达对底层的虚拟指令集拥有完全控制权,只要英伟达在新架构中微调寄存器分配方式或者编译器逻辑,外部的转译层就会立刻报错失效,厂商必须重新投入团队排查修复。
只要继续按照英伟达制定的接口规则写代码,非英伟达硬件就永远无法摆脱性能落后与被动跟随的处境。
不给老黄交过路费,华为和DeepSeek重写了一套游戏规则
既然跟着原来的规则走不通,DeepSeek和华为这次干脆绕开了专有接口,直接联合搭建了一套硬件中立的底层开发底座。
这次破局的技术核心,是北京大学计算机学院团队最初立项并开源的张量块编程语言TileLang。
在以往的专有开发模式下,工程师为了让芯片跑满算力,必须用底层语言手动控制每一个线程去显存的哪个具体物理地址抓取数据,还要手动协调不同层级之间的数据搬运。
这种写法不仅工程量巨大,而且代码只能针对特定型号的芯片生效。
TileLang采取了高级抽象的设计思路。程序员只需要用类似Python的语法直接表达数据矩阵如何切分、如何做乘加运算等数学逻辑,至于芯片底层的线程分配、缓存占用和指令执行流水线,全部交给TileLang编译器在后台自动规划。
以大模型中关键的注意力加速算子为例,在原先的底层开发环境下往往需要编写五百多行代码,而在TileLang下只需要大约八十行就能完整表达,编译后的运行效率同样能达到硬件的物理计算上限。
TileLang在顶层统一了算法描述,在编译器后端既可以直接输出英伟达的虚拟指令,也能直接输出华为昇腾芯片底层的硬件指令以及专属开发接口。
程序员写完一套算法,可以在两套完全不同的硬件架构上直接编译运行。
基于这套中立语言,DeepSeek将自身前沿大模型研发中沉淀的六大核心底层组件全部移植到了昇腾架构上,并面向全球开源。
这其中包括专门处理混合专家模型跨节点通信的通信库DeepEP。
根据昇腾平台的实测数据,其跨节点分发带宽达到了每秒375吉字节,合并带宽达到了每秒347吉字节,大幅降低了多机互联时的网络等待时间。
同时开源的还包括矩阵乘法加速库DeepGEMM,硬件配合方面,双方基于华为昇腾950芯片,打通了支持单层交换带宽达到每秒3.2太比特的128卡超节点架构,并支持扩展到二十五万六千卡的大型集群。
在实际部署测试中,运行DeepSeek最新的闪电版模型时,如果把单个字符的输出延迟控制在五毫秒以内,单张计算卡的输出吞吐量达到每秒2469个标记;如果把延迟放宽到十毫秒,单卡吞吐量能进一步提升到每秒5102个标记。
这套实测数据证明在剥离了转译损耗之后,国产硬件运行主流大模型完全能跑出极高的实际吞吐能力。
代码虽然全送出去了,但要把英伟达拉下马还得看三道硬指标
手里握着跑得通的高效技术,DeepSeek和华为却没有选择把软件做成自己的专有壁垒,而是直接向全社会完全公开。
这种看似亏本的决定背后是出于实际的产业考量。
根据产业公开数据,DeepSeek在2026年的年化收入已经突破十亿美元,市场估值向五千亿元人民币迈进。
根据产业链相关信息,DeepSeek正计划在内蒙古乌兰察布的数据中心采购部署超过十六万块华为昇腾芯片,整体硬件预算超过二十五亿美元。
作为一家超大体量的人工智能公司,其内部超过百分之七十的算力都必须投在基础模型的研发训练上。如果长期单一依赖海外芯片供应,不仅需要承担极高的硬件采购溢价,还要承受随时断供的交货风险。
把这套软件无偿开源,本质上是在通过降低开发成本来联合更多产业力量。
对于国内其他从事通用图形处理器研发的厂商来说,此前每家芯片的软件环境都不一样,必须耗费大量工程师去一家一家游说算法团队做适配。
而在TileLang和这套开源组件推出之后,其他芯片企业只需要为自己的硬件编写一个TileLang编译器后端,就能直接承接DeepSeek现成的高性能算法生态,不必再把有限的资源消耗在重复适配底层环境上。
对于全球企业客户和云服务商而言,开源软件底座给市场提供了新的选项。
只要经济成本更低、运行效率达标,数据中心在采购时就多了一个议价筹码,英伟达原先的垄断溢价就会受到实质挤压。
不过,如果站在产业全局客观分析,软件开源虽然迈出了一大步,英伟达的优势地位也绝不可能在一夜之间彻底颠覆,后面依然面临三道硬性门槛。
第一道门槛是科学计算长尾软件的生态惯性。第二道门槛是开发者的使用习惯。第三道门槛是先进硬件制造与产能供应。
综合来看,DeepSeek与华为联手开源底层软件,是走出了一条中立开放的新路线。英伟达建立二十年的算力垄断固然庞大,但当全球开发者拥有了第二种高效且免费的技术选择时,算力市场原有的闭源垄断逻辑,已经出现了无法逆转的松动。
信息来源:《全面开源昇腾基础设施:DeepSeek携手华为打破算力生态壁垒》|量子位|2026 年 9 月 30 日
热门跟贴