前阵子重看黄仁勋4月那场Dwarkesh Patel播客,越看越觉得,外界把他的话读浅了。
主持人问他,如果DeepSeek这类模型先在华为平台上跑、还针对华为架构做优化,会怎样。黄仁勋原话大意是:若这类模型在非美国硬件上开发、且跑得最好,对美国会是“非常糟糕”“灾难性”的结果 。当时不少人撇嘴,觉得老黄是为游说放开对华芯片出口、多卖H20那点事。
可等华为全联接大会把昇腾960、灵衢、Hi-ONE、鲲鹏超节点一连串东西摆出来,再回头看,他的担心不是“一张卡打不过另一张卡”,而是“默认规则要换人写”。
一、英伟达最深的护城河,不是GPU,是默认项
早些年做AI,新模型出来先想CUDA、先调英伟达,几乎像写文档先想Word一样自然。不是别的卡不能跑,而是算子、框架、调试工具、老代码、工程师习惯全在CUDA那边。换栈要重写kernel、重校精度、重排并行,按月算工作量 。
所以黄仁勋怕的不是华为卖几万张卡,怕的是头部开源模型把华为CANN、昇腾算子、超节点互联当“一等公民”来调。一旦DeepSeek级模型在华为上首发、且延迟和吞吐都调到位,后面高校、创业公司、海外小团队就会跟着学这套。CUDA从“唯一首选”变成“可选项之一”,英伟达最值钱的不只是芯片,而是“大家都先找它”的位置。
这点4月就说中了:若模型针对华为架构优化并跑得最好,美国技术栈吸引力会被削弱 。
二、DeepSeek适配昇腾,关键不在“能跑”,在“长文本生产指标”
4月24日DeepSeek发V4-Pro、V4-Flash,上下文从128K扩到1M 。同日华为计算公布昇腾全系适配:A2、A3、950都进生产支持;950用融合kernel、多流并行、量化压Attention;A3给训练参考实现,华为云MaaS可一键调V4-Flash 。
离线benchmark有两组数,得说清楚场景,不然像厂商稿:
8K输入下,V4-Pro在昇腾950超节点、TPOT约20ms时单卡Decode 4700TPS;V4-Flash同场景TPOT约10ms、单卡1600TPS。A3 64卡配大专家并行、vLLM跑Flash,8K/1K输入输出单卡Decode 2000+TPS 。
这几个数只代表离线压测,不含线上调度、混部、限流。它的意义不在“吊打谁”,而在于长上下文推理有了可落地指标。过去国产卡最怕MoE、长KV、Agent调用,一上生产就掉链;现在至少把“能进业务”的门槛降下来。
更关键的是多后端。V4同时验证英伟达和昇腾,稀疏注意力等效率技术在两边跑 ,模型厂不必把身家全押单栈。对美国来说是分散化,对国内是抗风险。
三、单卡追不上,就用“系统”把有效算力拉回来
老实说,昇腾高端单卡对比英伟达GB200、Vera Rubin这类路线,仍有代差。华为这几年聪明的地方,是不硬拼单点,改拼超节点。
早期英伟达用NVLink把多卡绑大域,再InfiniBand组集群,解决“百卡拼一起只用三四成”的老问题 。华为对应做几层:
灵衢UnifiedBus,把服务器内、机柜内、跨柜、集群不同互联协议统一,减少协议转换;官方材料称超节点内可统一编址、全局内存访问 。
昇腾950超节点按64卡一个机柜单元扩展,公开称可8192卡无收敛全互联;960在2026全联接发布,单超节点1024到4096卡,8E FLOPS FP8、1PB HBM,正交架构加全液冷,2027年分阶段交付 。
Hi-ONE做NPO近封装光。传统800G可插拔光模块放机柜背,芯片到光口还得走几十厘米铜电,要DSP重定时,耗电、发热、故障率都高。华为把光引擎放到芯片附近,960超节点用5500个Hi-ONE替代4.8万颗800G模块,公开口径省550kW以上,无故障时间翻倍,可用度99.8% 。
鲲鹏补通算。Agent跑代码、调库、管上下文,不全是NPU活。鲲鹏超节点基于灵衢全光,最大4096节点、256TB统一内存,十万级沙箱启动比传统方案快约30倍 。M900做PB级KV缓存,基于灵衢一跳直连,长上下文少搬数据 。
逻辑就一句:单卡弱,用互联、统一内存、光通信、CPU协同把“系统有效算力”补起来。十万亿参数时代,不会靠一张卡救场。
四、为什么这事会让出口管制“反效果”
美国限高端英伟达对华销售,本意拖慢训练。但有两个副作用躲不开。
一是逼模型厂做多后端。DeepSeek V4在英伟达、昇腾同步验证,寒武纪、天数智芯也做V4适配 。多后端一旦成习惯,CUDA“默认首发”的垄断性就松。
二是逼系统厂做全自有。华为有光通信30年底子、有运营商协议底子、有芯片到存储到云全链条,灵衢开源、CANN常态化开源、Hi-ONE自研NPO,不是买现成模块拼机架 。制裁越严,国内大客户越不敢单押一家海外GPU,反而给国产栈留生产环境。
黄仁勋自己也在播客里说,严厉管制可能促使中国生态专注内部架构;放弃中国这个第二大科技市场,长期会催生独立技术栈 。他不是唱衰美国,是指出“封芯片容易,封生态难”。
五、但也别写成“已经全面超英伟达”
客观坑还在三处。
训练全链路:DeepSeek公开强项目前更偏推理协同和微调参考;从头预训练万亿模型、万卡数月稳定、故障快速回滚、精度对齐CUDA生态,昇腾仍在追。不能拿离线推理TPS代替全量预训练成熟度。
软件深度:CANN已开源,外部开发者占比、PyTorch官方支持、vLLM/Triton等适配都在补 ,但第三方教程、老项目迁移、底层调试资料仍不如CUDA厚。企业迁栈前两年肯定疼。
交付与供给:960要到2027年分阶段来,910C超节点已部署超1000套、950规模商用 ,但HBM、先进封装、晶圆产能都影响扩张速度。模型厂想全切国产训练,要看交付不看PPT。
所以更准确的说法:推理和部分训练场景,昇腾已能当生产级备选甚至主力;从头超大规模预训练,国产栈还在爬坡。
六、普通读者记住三句话就行
看AI自主,不先看“相当于H100百分之几”,先看三件事:千卡统一内存做到没、长上下文单卡时延多少、模型是否原生适配。
看生态之争,不先看谁跑分高,看开发者愿不愿意为新硬件写算子、写教程、踩坑发帖。CANN外部开发者占61%、月活5200多,PyTorch官网可装昇腾后端,这类指标比单篇软文靠谱 。
看中美博弈,不把“禁运”理解成“打死”。禁运短期卡性能,长期可能逼出第二技术栈。黄仁勋那句可怕,本质怕的是非美栈从备选变首选——这比某款芯片跑分反超更长远。
以后再看到“DeepSeek选华为”的标题,别只吃情绪。真正值得盯的是:V4在昇腾上是不是长期更新、960交付后万卡训练稳不稳、CANN能不能让小公司零改代码迁移。这三件事成了,黄仁勋的“可怕”才不是比喻,而是现实。
热门跟贴