我先问大家一个问题,你上大学那会儿,计算机课第一章学的是什么?我想十有八九是冯·诺依曼的体系结构吧。这个结构是1945年定下来的老规矩,它的原理是把程序和数据存在同一个内存里,然后让CPU一条一条取指令执行。这个结构从全球第一台通用电子数字计算机到现在你手里的笔记本电脑已经执行了七十多,它就像房子的地基,你天天住在上面,从来不觉得它有什么问题。
但现在有人觉得它有问题了,近日,华为在上海全联接大会上正式发布了一套全新的计算架构,这个架构名字叫Peerium。华为轮值董事长徐直军站在台上说了一句很重的话:这套架构能在编程模型、系统架构和互联拓扑三个层面,同时突破图灵范式与冯·诺依曼单机架构的限制。这句话是啥意思呢?简单说就是,百万级处理器不再是一堆独立机器拼接在一起,而是变成一台真正更大的计算机。
消息一出,网上掀起了很大的讨论。有人说这是计算机基础理论的历史性突破,有人冷静地提醒说这更像是在系统工程层面对冯·诺依曼架构的扩展,离推翻底层理论还远。两边说的其实都有道理,但不管大家怎么评价,这件事本身确实值得好好探讨下。
为什么华为的这个架构那么重要?因为算力这个东西真的遇到坎了
现在的大模型越来越大,其参数动辄千亿万亿,一台机器装不下也算不完,厂商能做就是把成千上万台机器拼起来用。可是拼起来之后有个大毛病,那就是机器之间的数据来回搬,互联带宽就成了瓶颈。当机器的数量越多,其效率反而上不去了。实际情况也确实如此,有数据显示,十万卡规模的AI集群有效算力利用率目前大概只有两成。也就是说你花了一百块钱买算力,实际能用的只有二十块,剩下八十块都浪费在了机器之间互相扯皮上。
所以现在的局面很清楚了,厂商光堆芯片数量已经走到了天花板,瓶颈不在单个芯片有多快,而在一堆芯片能不能像一台机器那样协调干活。这就好比一个工厂,你招了一万个工人,每个人都很能干,但这些人没有统一调度,各干各的,甚至互相踩脚,最后工厂的实际产出跟一千个人差不多。那问题出在哪?不是工人能力不行,而是工厂的管理架构不行,现在华为Peerium架构解决的就是这个管理架构的问题。
华为Peerium架构是怎么解决这个问题呢?
那么有人就会问了,你说华为Peerium架构能够解决这些问题,那么它到底是怎么解决的呢?它靠三样东西,第一是嵌套并行,即任务不是简单地分给一堆机器去做,而是分层递归组织,像套娃一样,大任务里套小任务,小任务里再套更小的任务,每一层都有自己的协调逻辑。
Peerium架构的第二能力是统一内存寻址,让百万级处理器共享同一套地址空间。说共享同一套地址空间,大家听起来有些拗口,这就像以前每个工人自己有个小本子记账,互相查账特别费劲。现在所有人看同一本大账本,谁需要什么数据,直接查,不用跑来跑去问。
Peerium架构的第三个能力是平等互联,目前传统的架构是有主有从的,一台主机管着下面一群处理器,所有事情都得汇报请示。Peerium架构把这些处理器之间的主从关系取消了,谁都能直接跟谁通信,不用经过中间人。所以华为的这套架构的设计目标用大白话说就是让一百万台处理器不再是一百万台电脑的拼凑,而是一台一体化的电脑。
这个架构放到全球算力竞争的大背景里看,意味着什么?
那么华为的Peerium架构对全球AI算力市场有什么影响呢?目前英伟达是全球AI算力市场绝对的老大,它的GB200 NVL72把72颗GPU接入同一个NVLink算力域,可以扩展到576颗。通俗的讲,英伟达走的也是让芯片更紧密协作的路线,但它的出发点和实现方式跟华为不一样。英伟达的优势在于GPU本身性能极强、CUDA生态极为成熟,围绕它的开发工具和软件栈已经形成了一道很深的护城河。
华为的Peerium走的是另一条路,它不在单芯片性能上死磕,而是从架构层面重新设计整个计算体系。它把互联协议统一归一、对外开放,设备谱系从8卡一体机一路延伸到百万卡集群。如果这个思路走通了,那么算力竞争的主战场将从谁的芯片更强变成谁的集群协同效率更高。这就好比以前大家比的是哪个士兵最能打,现在比的是哪支军队的指挥系统最高效,战场的胜利标准变了。
不过我们还是要认清差距,Peerium架构还有不少问题需要解决
看到这里,我估计部分华为粉丝可能会非常兴奋,认为华为改变了AI算力市场,超越英伟达已经是板上钉钉的事情。但我还是要劝这些人冷静,架构创新听着确实很激动人心,但落地验证才是硬道理。
目前华为的Peerium架构有几个关键问题绕不开,Atlas 950部署后的实际训练效率到底怎么样?百万卡集群对昇腾960等后续芯片的按时就绪有多大依赖?Nested BSP这套全新的编程模型,开发者买不买账,生态能不能建起来?存量系统向灵衢迁移的成本和周期是多少?这些问题都不是喊几句口号就能回答的,每一个都需要在真实的客户环境里,一个一个去验证。
另外有一点我觉得特别值得说明一下,华为做这件事的背景是在受到外部技术封锁的条件实现的。而冯·诺依曼架构统治了七十年,这不是因为它完美,而是因为整个产业链都围绕它运转,没有人有动力去动这个根基。华为现在动了,一部分原因是被逼的,另一部分也说明它确实有了一定的技术底气。
从更大的视角看,全球AI算力的需求还在爆炸式增长。大模型参数向几十万亿演进,现有的集群架构越来越力不从心。不管华为的Peerium最终能不能成为行业标准,它能够解决怎么让百万级处理器真正高效协作,而不是低效地堆叠。这个问题不解决,AI的发展就会被算力瓶颈卡住。
所以我觉得与其讨论华为这是不是颠覆了冯·诺依曼结构,不如关注一个更实际的问题,那就是华为的这套架构能不能在真实场景中跑起来,跑得好不好,成本够不够低,开发者愿不愿意用。
七十岁的冯·诺依曼架构在今天迎来了一个认真的挑战者,这场挑战的结果会怎样,现在下结论太早。但有一件事是确定的,AI时代对算力的需求正在把人类逼向计算机体系结构的根本性变革。华为已经迈出了这一步,其他厂商也要加油了。
热门跟贴