2026年5月19日,上海前滩香格里拉。AMD董事长苏姿丰(Lisa Su)站在聚光灯下,对两千多名中国开发者说了一句过去二十年没有任何一家美国芯片巨头CEO公开说过的话:

"中国,是AMD产品路线图的核心部分。"

打开网易新闻 查看精彩图片

在大洋彼岸,英伟达CEO黄仁勋也曾亲口承认,受出口管制影响,英伟达在中国高端AI加速卡市场的份额"已归零"。

一边是好不容易跨进门的客人说"我重视你",一边是曾经垄断者被挡在门外。放在三年前,这一现象想都不敢想。剧情的反转是中国AI算力市场本土三大芯片势力迅速崛起给予的底气。

他们是华为昇腾、寒武纪、海光信息。外界叫它"国产AI芯片三驾马车",但在那些熬夜调板卡、改编译器的工程师眼里,这更像一场各怀绝技的"破壁者联盟"

铁幕:从95%垄断到"归零"警告

把时间拨回2020年以前。中国AI训练与推理芯片市场,英伟达占有率高达95%,剩下的5%里还有AMD的 scraps。CUDA是不二法门,H100/A100是硬通货,买不到?等项目排队。那时国产芯片连"备胎"都算不上——顶多是PPT。

转折始于2022年10月美国首轮对华AI芯片出口管制,随后几轮持续收紧,H100/A100禁售,特供版H20性能阉割且前景不明。倒逼之下,三大国产路线悄然从"实验室验证"走向"商业放量"。

IDC数据显示:2025年中国AI加速卡总出货约400万张,国产厂商合计出货165万张,市占率首次突破41%;英伟达份额从早年95%跌至约55%,高端训练卡实质归零。铁幕没完全碎,但门缝里已透进光。

华为昇腾——"全栈自主派":从被制裁到定义标准

"你不能只做芯片,你得自己做编译器、框架、集群拓扑——否则永远被人掐脖子。"

华为走的是三条路线中最决绝的一条:从指令集(达芬奇架构)、CANN异构计算架构、MindSpore框架到Atlas服务器,全栈自研。

关键里程碑:

昇腾910B(2023–2024量产):FP16~320 TFLOPS,64GB HBM2e,在国内智算中心批量部署

昇腾910C(2025量产):FP16达800 TFLOPS,128GB HBM2e,多卡互联带宽784GB/s,部分场景逼近A100

昇腾950PR(2026Q1量产):首搭自研HBM,FP4算力1.56PFLOPS,Atlas 350加速卡算力达英伟达H20的2.87倍

生态突破:DeepSeek V4发布首日即完成昇腾原生适配("Day 0适配"),标志CUDA垄断在中国市场被实质性挑战

2025年华为昇腾出货约81.2万张,占国产总出货近50%,稳居国产第一、全国市场第二(仅次于英伟达存量)。运营商、政务云、央企智算中心是其基本盘。

代价也很清楚:CANN生态较CUDA仍有差距,模型迁移需重写算子;但"全自主"意味着在美方极限施压下,它是唯一不会被断供升级的路线。

打开网易新闻 查看精彩图片

寒武纪——"推理场景专精派":八年亏损,一季翻身

"训练归训练,推理才是真正的生意。我们要做的是——让每元钱Tokens产出最大化。"

寒武纪(Cambricon)是国内最早登科创板AI芯片公司,早年间因"烧钱难盈利"饱受争议。转折发生在2025–2026年:

思元590(2025量产):7nm Chiplet封装,FP16算力256 TFLOPS,INT8达512TOPS,96GB HBM2e,综合性能接近A100的80%,功耗低约15%

思元690:送测中,预计翻倍提升

商业爆发:2025年全年净利20.59亿元(首年扭亏);2026年Q1单季净利10.13亿元,同比+185%,合同负债从0.01亿跳升至3.96亿——预示后续订单饱满

客户结构:字节跳动(第一大客户,占营收超26%)、百度、阿里等在搜广推、内容理解等推理场景大规模部署

寒武纪的策略很清晰——避开英伟达最强的大规模预训练阵地,专攻互联网大厂海量推理负载,通过自研BangC/BangC++软件栈做CUDA兼容层,将迁移成本压低约70%。这是一门苦活、细活,但2026年中国AI推理算力需求已数倍于训练——它赌对了时间点。

打开网易新闻 查看精彩图片

海光信息——"兼容迁移派":借AMD衣钵,做CUDA最短路径

"如果你打不赢CUDA,就做它最像的那个兄弟。"

海光是三者中最特殊的:早期获得AMD x86 CPU及GPGPU(DCU深算系列)技术授权,走x86 CPU + DCU双芯驱动路线。其DCU的DTK软件栈兼容ROCm/HIP接口,对CUDA代码迁移成本极低——不改或微改即可跑。

深算二号(DCU K100系列):接近A100水平,主要用于HPC+AI推理,在金融、电信、超算(比如济南超算)有稳定部署

2025年业绩:营收143.77亿元(+57%),净利25.45亿元;2026年Q1营收40.34亿元(+68%),存货73.3亿创历史新高,预示备货旺盛

生态适配:已与DeepSeek、Qwen3、混元、智谱等365款主流大模型适配,覆盖全球99%非闭源大模型

批评者说它"架构源自AMD授权、自主性存疑";支持者说——在合规前提下,它是现有CUDA存量代码平滑迁移成本最低的选项,且x86 CPU与DCU可在同一机柜内构成完全国产算力节点,符合信创100%国产化时间表要求。

打开网易新闻 查看精彩图片

"铁幕"不会自己碎——是人凿开的

此次,无论是AMD高调宣布免费GPU开发者计划、与魔搭ModelScope合作,还是,苏姿丰称"中国是我们路线图核心"。其本质上是在英伟达退场后,争夺"第二选择"的生态心智

但对国产三强而言,AMD既是潜在的异构算力补充,其ROCm开放策略也间接给海光DCU、乃至寒武纪兼容层提供了参照系。

更有意思的是,AMD董事长苏姿丰在上海的大胆预言Agentic AI时代CPU与GPU比例将从1:4走向1:1,这恰恰呼应华为、海光本就有强力x86/ARM CPU业务的"双芯"布局。国产算力破壁,正从"单卡追平GPU"升维到"系统级异构优化"。

打开网易新闻 查看精彩图片

不过,我们也要保持清醒的认知,2026年的中国AI算力市场,还远没到国产"完胜"的地步。超大规模预训练集群的多卡通信稳定性、软件栈成熟度、先进制程HBM供应,都与国际芯片巨头存在实打实的差距。

但有一点可以确定:英伟达从95%垄断到高端份额归零,国产三强拿下41%市场,这不是施舍,是国内的工程师无数个日夜硬凿出来的。

苏姿丰来上海说"中国是核心",这是对AI算力市场需求的客观现实的尊重。而华为昇腾、寒武纪、海光这十几年默默垒起的指令集、编译器、驱动和板卡,则是对"中国算力主权"完美诠释。

笼罩在中国AI算力市场头顶的铁幕仍在,但裂缝已现。

真正的破壁者从来不是等待对方开门,而是自己磨出钥匙。

下次有人问你"国产AI芯片到底行不行",不妨反问——

"你觉得七年前那群在浦东机房熬夜调PCIe信号的工程师,会放弃吗?"

其实,答案就写在每一张点亮的思元、每一台Atlas机架、每一个跑通的海光DCU终端上,国产的崛起替代之路无法阻挡。