你敢信,全球最大GPU厂商的老板,背地里推演中国芯片产业走向,一口咬定我们会陷入内斗碎片化,最后还得求着买他的产品。结果我们八家国产芯片厂,一天就把他预想的死局走通了,这脸打得,估计黄仁勋自己都始料未及。

打开网易新闻 查看精彩图片

原来咱们国产芯片跑一款新出的开源大模型,是什么体验?工程师得熬夜逆向工程,手写算子翻译代码,磨个三到六个月才能跑通。AI赛道现在卷成什么样,半年空窗期足够把任何玩家甩得没影,所以不少客户嘴上喊着支持国产,手还是不自觉点开了英伟达的采购页。

今年四月下旬,剧情直接来了个大反转。DeepSeek V4预览版刚上线,不管是参数规模还是架构设计都相当能打,真正炸圈的是紧跟着公布的适配名单。智源研究院牵头的FlagOS开源栈,同一天就宣布完成了V4-Flash的适配,覆盖华为昇腾、海光、寒武纪等八家国产芯片,连英伟达自己都在名单里。海外科技媒体直接评价,中国国产芯片版图,一天就完成了多样化布局。

打开网易新闻 查看精彩图片

有个细节很多人没注意,DeepSeek发布V4用的权重精度,本来是英伟达最新硬件才原生支持的路径。FlagOS团队愣是反向拆解了一遍,让没有FP4支持的国产芯片也能顺利跑通同一份权重。同一个模型,不同硬件,零延迟同步上线,这种事放在两年前,说出去根本没人信。

黄仁勋其实很早就把话说得很透,他说英伟达的护城河从来不是芯片本身,是CUDA生态攒了二十年的开发者资源,数百万绑定死的框架和模型。他也明说,客户理论上完全可以替代CUDA,现在已经有客户在这么做了。话听着客气,意思其实很明白,正面硬攻CUDA太难,绕开它还有点可能性。

打开网易新闻 查看精彩图片

咱们选的恰恰就是绕开这条路,核心用的是OpenAI推出的Triton,一种不绑定任何一家硬件的通用算子编程语言。再配上智源的一整套开源中间层,大模型团队只要写通用代码就行,各家芯片厂只需要做一个后端转接头,把通用代码转成自家芯片能读懂的指令就行。打个通俗的比方,以前做菜必须用英伟达牌的锅铲配英伟达的灶台,别家厨具根本不认,现在Triton这套统一了菜谱标准,你想用啥锅都行,只要每家灶台配个对应的转接头就搞定。原来顶级工程师要写两周的算子代码,现在编译器几个小时就能生成可用版本,曾经让人头疼的组合噩梦,直接变成了简单的加法题。

单颗芯片性能比不过怎么办?咱们国产的解法就是集群加算法凑。DeepSeek搞的双向流水线和跨节点通信库,能把节点之间的通信时间几乎完全塞进计算间隙,运行起来根本看不出停顿。说直白点,英伟达那边是一辆几百万的超跑,单车速度快但装货有限,咱们国产芯片是一整支重型货车队,单车速度差点意思,但胜在便宜量大调度还聪明,最后总的吞吐量愣是能追上超跑。

打开网易新闻 查看精彩图片

看看英伟达最近的动作,就知道它自己也真切感受到了压力。八月上旬黄仁勋亲自跑华尔街,拉着六家顶级资本巨头搞了个能撬动五千亿美元的算力融资平台,把GPU集群包装成投资级资产,让客户拿算力做抵押融资,融来的钱再回头买英伟达的芯片。紧跟着英特尔增发股票、AMD发行债券,四天之内三家合计动用了超过五千四百七十亿美元的资金杠杆。说白了,AI基建烧钱的速度已经超过了科技巨头自身的现金流承受能力,连英伟达都得把“谁来买单”这个问题甩给资本市场。

市场买不买这个账?消息公布当天,英伟达的信用违约互换指数一度创下两周最大涨幅,这里面的意思,懂的都懂。还有一个很容易被忽略的点,AI不管训练推理都烧电,那烧的可都是真金白银。美国不少数据中心密集区的批发电价,这几年翻着倍往上涨,还出过“买到了H100却申请不到并网名额”的怪事。咱们国内西部算力枢纽节点的工业电价,常年维持在每度三毛钱左右,全生命周期算下来,运营成本能比美国低一半到三分之二。这个优势不是靠某一项黑科技堆出来的,是咱们几十年基建功底一点点攒出来的硬实力。

打开网易新闻 查看精彩图片

纵观整个产业发展历史,任何被吹得神乎其神的硬件垄断,最后都不是被正面撞垮的。当年Wintel联盟号称三十年不可撼动,结果被安卓iOS靠Java虚拟机绕开了。IBM的Unix专有小型机风光一时,最后被开源Linux加通用服务器慢慢瓦解。现在Triton加FlagOS,再加上八家国产芯片同日适配,扮演的就是当年那个“绕行者”的角色。

还有个小细节值得唠唠,七月二十四日黄仁勋开通海外社交账号,第一条推文没推销英伟达任何产品,反倒联名二十多家美国科技公司发了一封公开信,力挺开源权重模型。表面看是行业倡议,往深了想,连英伟达都开始给开源开放模型站台,说明它自己心里比谁都清楚,闭源垄断的路走不长远了。

打开网易新闻 查看精彩图片

黄仁勋原本推演的中国芯片内斗剧本,前提就是资本利益一定会压过产业协同。他低估了,外部持续施压之下,我们全产业链追求自主可控的共识能凝聚得这么快。从做底层芯片的,到写开源栈的,再到搞前沿大模型的,全链条各就各位,节奏踩得整整齐齐。CUDA这堵墙没被硬砸开,但一条不用交过路费的绕行新路,已经在旁边悄悄修通了。

参考资料:新华网 八家国产芯片同日完成DeepSeek V4适配