2026年9月17日,上海,华为全联接大会2026的舞台上,轮值董事长徐直军正式对外抛出一个目标:把百万级处理器聚合为同一台计算机。 台下不少工程师脑子里同时在算另一笔账。西方对台积电先进制程代工与顶级EUV光刻机的限制摆在那里,单颗芯片能挖到的算力上限被焊死,沿着单机堆晶体管密度的老路,还能走多远? 华为的回答干脆利落——不再死磕单颗芯片上的晶体管数量,转而用互联技术和编程模型,把百万颗国产处理器拧成同一台超级机器。制程追不上,架构接过了算力增长的接力棒。

打开网易新闻 查看精彩图片
01 一台由百万颗芯片组成的计算机这套全新计算架构有个名字,叫Peerium,由徐直军在全联接大会2026上主讲发布。架构的三根支柱分别是嵌套并行、统一内存寻址和平等互联。按华为的说法,三者协同之后,百万级处理器可以像一颗芯片那样协同工作,而不是像传统集群那样各自为战。需要说明的是,百万级强扩展是华为对外宣称的目标规模,而非已经跑通的现网数字。 首代落地产品跟着架构一起亮相,名字叫Atlas 950超节点,配套的开放总线叫灵衢UnifiedBus。这条总线是华为对外公开的互联标准,意图很明确——把机房里成千上万张加速卡,用一条高速通道编进同一个调度体系。 数字层面有几组关键参数值得拆开看。据华为发布,灵衢互联的时延从原来的约7微秒压到了约2微秒。别小看这5微秒的差距,在万卡级别集群里,一次通信往返省下的时间,乘以每秒上百万次的交互次数,累积下来就是实打实的有效算力。 光互联的替换规模更直观。Atlas 960方案用5500个NPO光引擎,替代了传统方案里约4.8万颗800G光模块,光模块数量砍掉接近九成。据华为发布,这套整机柜方案的可用度约99.8%,整机柜功耗比传统集群降低约550千瓦,机柜里的布线复杂度、故障点和散热压力也跟着一起下来。 存储侧配套的是OceanStor方案。它在这套架构里的角色,是基于灵衢总线一跳直连的PB级KV缓存——把海量热点数据放到离计算更近的地方,让处理器跨节点取数时少跑冤枉路。 芯片本身的价格信号也在释放。据彭博等报道,华为已把尚未上市的昇腾950DT意向报价上调到25万元人民币以上,近三个月涨幅约六成,预计2026年四季度才正式上市。一款还没发布的芯片,渠道意向价就先涨了六成——这种提前抢跑本身就说明,在单颗制程被卡的背景下,市场对国产系统级算力方案的渴望到了什么程度。 把这一串事实摆在一起,Peerium的定位就清楚了。它不是又一颗参数更猛的单芯片,而是一套系统工程级的回应——既然单卡密度短期补不上制程差距,那就用系统互联把成千上万个“次优单芯”拼成一个等效的超级算力池。
打开网易新闻 查看精彩图片
02 当单颗芯片追不上制程这套架构为什么在这个时间点被推到台前,得从传统集群的那堵墙讲起。 西方对台积电3nm以下代工和EUV光刻机的限制,直接后果是国产AI芯片很难在单晶体管密度上追上台积电最先进节点。单卡算力被锁在成熟制程,这是物理现实,绕不开。 传统AI训练集群用的是主从模式。一张主卡当“群主”,成千上万张从卡当“群成员”,每一步计算都要群主发令、从卡执行、再把结果汇总回群主。集群规模小的时候这套办法没问题,但一旦冲到十万卡以上,问题就冒出来了。 这堵墙行话叫通信墙。群主每秒要处理的指令和数据汇总量是跟着卡数指数级上涨的,群主一堵,全群跟着等。打个比方,一个一万人群里如果只有一个人有权发言,其他人只能排队等他点头,绝大多数时间大家其实是坐着发呆——算力就这样浪费在等指令上,而不是真正在算。 齐步走的编程模型又放大了这个问题。所有卡必须步调一致,前一张算完后一张才能动,谁慢了全队等谁。卡数一多,木桶效应特别明显,集群的有效算力根本达不到理论峰值。群主卡死群聊,是传统主从架构在大规模场景下的通病。 Peerium给的解法是从根上换一套规则。 第一招是统一内存寻址。传统集群里每张卡有自己的内存地址,跨卡调用数据要经过层层拷贝;统一内存寻址之后,百万颗处理器共享同一张地址簿,程序访问任何一颗卡上的数据,就像访问本地内存一样直接。单机冯·诺依曼瓶颈,被这套机制从系统层面绕了过去。 第二招叫Nested BSP嵌套并行,替代原来的主从齐步走。群里不再只有一个群主,而是分成若干小组,每个小组内部自己协调,组与组之间再按更大的节奏协同。没有人需要等同一个总指令员发令,空闲的卡立刻可以接活,木桶效应被压到最低。 第三招是平等互联。没有谁是固定的主卡,也没有谁是固定的从卡,百万颗处理器在网络里地位对等。逻辑上,这一柜一柜的机器不再是“很多台电脑联网”,而是一台百万核心、内存近乎无限的超级单机。 但硬币的另一面必须摆到桌面上,不能只讲好的那一半。 第一面:百万级强扩展目前仍是华为自称的目标,不是已经跑通的现实。从Atlas 950这个超节点,到真正十万卡、百万卡级别的稳定运行,中间隔着良率、互联损耗、故障率、故障后自动恢复等一连串工程难题,需要长期真实负载验证。架构图画得再漂亮,机房里连续跑几个月不宕机才算数。 第二面:制程差距不会因为架构重构就消失。单颗芯片的晶体管密度、能效比、主频,这些物理指标仍然受制造工艺约束。架构能做的,是把有限的单芯算力压榨出更高的系统利用率,但它变不出先进制程才能给的晶体管数量。先进制程在可预见的未来仍是国产算力的长期短板,系统架构是缓解这一短板的杠杆,不是替代它的魔法。 把这两层放在一起看,行业里正在发生的事就清晰了。后摩尔时代,算力的爆发点正在从晶圆厂里的微米级较量,转向系统架构层面的工程级重构。一边是英伟达主导的封闭CUDA范式,软件栈绑死在自家硬件上;另一边是华为试图用灵衢开放总线撬动的开放范式,鼓励更多厂商把自己的卡接进同一张地址簿。 华为的赌注押得很明白:即便单颗芯片在制程上落后一到两代,只要互联带宽、时延和编程模型足够好,万卡甚至百万卡集群跑出来的有效算力,照样可以把大模型训练这件事扛下来。 03 从芯片战到架构战Peerium真正证明的,不是某一颗芯片追上了谁,而是一件更底层的事——被卡的是单颗芯片的天花板,但算力的天花板,完全可以用系统工程的方式从上面掀掉。 这两个层次不能混为一谈。Atlas 950超节点是已经落地、可以出货的产品,百万级处理器协同是华为画出的路线图目标。从现在的超节点到百万级的目标,中间还有良率爬坡、互联稳定性、故障自愈能力一整条长路要走。把路线图说成既成事实,是对技术规律的不尊重;但因为路线图还没跑完,就否定架构方向,同样站不住。 灵衢这条开放总线能不能真正长成对标CUDA的开放生态,是后续最值得盯的变量。目前接入灵衢的,主要还是华为自身体系内的昇腾卡、Atlas服务器和OceanStor存储。如果未来更多第三方芯片厂商、服务器厂商、云厂商愿意把自己的设备接进这条总线,统一内存寻址和平等互联的优势才会被放大成行业级生态;反之,如果生态始终封闭在华为体系内,那它更像一个高性能私有方案,而不是一次范式级的开放。 这条路到底有多长,不妨拆成几道工程题来看。万卡集群里任何一颗卡、任何一根光互联线出故障,系统都必须在毫秒级把任务切走,不能让一张卡的异常拖垮整柜;海量节点之间的地址簿要保持一致,通信开销本身也会吃掉一部分算力;良率则决定了同样标称的集群里,真正能投入训练的有效卡数到底有多少。这些问题没有一个是靠架构图能自动解决的,都要靠真实负载一柜一柜跑出来、一个版本一个版本磨出来。 这件事放在中国算力产业的纵深里看,逻辑链就更完整。先进制程被封锁,短期看是单芯算力吃亏,长期看反而把整个产业的创新方向逼向了另一条路——既然晶圆厂那条路暂时走不通,那就把系统架构这篇文章做足。背后是封闭路线与开放路线的长期较量,不是一场一两年就能见分晓的比赛。 视线最后落回机房。一柜又一柜的国产加速卡,通过灵衢这条总线接入同一张地址簿,程序跑起来的时候,工程师面对的不再是一万台各自独立的机器,而是一台逻辑上把上百万颗处理器当成一颗来调度的单机。单颗芯片的制程差距,被这套系统级的编排悄悄抹平了一大截。 当制程追不上,架构成了算力新的增长曲线。这不是在封锁面前低头妥协,而是换了一条赛道,重新起跑。