谁能想到,美国攥着高端GPU卡了我们四年,连甩四轮封锁,就想把中国超算摁在E级门槛外头。结果今年国际超算大会一放榜,直接给所有人整懵了,我们自己搞的灵晟超算,愣是绕开美国卡脖子的路线,直接登顶全球榜首。这还是我们时隔九年重新拿回第一,反差感直接拉满。

打开网易新闻 查看精彩图片

之前全球超算圈有个默认的规矩,想冲每秒百亿亿次以上的E级性能,必须走CPU搭GPU的异构路线。毕竟GPU天生擅长并行计算,给大规模运算提速是一把好手。美国最牛的酋长石超算,就是这套路线的代表,用AMD处理器加四万四千多块AMD加速卡,全靠堆GPU堆出性能。这套路线还有个隐藏的“便利”,高端GPU全攥在美国企业手里,掐脖子太方便了。

这套路线天生有个绕不开的bug,CPU和GPU之间要频繁搬数据,效率天生上不去。酋长石的HPL实测效率才64%,等于说三分之一多的硬件性能,全耗在数据传输路上了。咱们的灵晟偏不凑这个热闹,直接换了赛道,全机搭了四万七千颗华为鲲鹏定制处理器,一块GPU加速卡都没带。买不到高端GPU就干脆绕开,这思路直接把美国都整懵了。

打开网易新闻 查看精彩图片

灵晟不是瞎堆CPU,是直接给每个CPU内核都内嵌了AI矩阵加速单元,不用把数据搬到别的芯片上处理,直接省了传输损耗。最后实测效率干到80.3%,比酋长石高出整整16个百分点。之前同样走纯CPU路线登顶的日本富岳,就是普通堆CPU,效率才六成出头,灵晟直接把纯CPU路线的效率上限往上捅了一大截。更贴真实科研场景的HPCG测试,灵晟也拿了第一,说明不是专门为了跑分调的机器,真能扛活儿。

灵晟的能效比也相当能打,整机用了100%全液冷设计,每瓦能跑51到52亿次浮点运算,比富岳高三倍多。整机功耗才42.2兆瓦,没有平白浪费性能,实打实把算力用在了刀刃上。

这套方案能成,靠的还是全产业链自主的硬实力。从芯片设计、高速互联、操作系统到整机集成,国内伙伴全栈打通,华为不只出了定制鲲鹏芯片,还把做5G基站的互联技术、做鸿蒙的调度逻辑都搬了过来。超算最难的从来不是把几万颗CPU拼在一起,是让几万颗芯片同时干活不说起来这事儿还得说回美国的四轮封锁,本来是想拦我们,结果反而逼我们走出了新路。2015年第一轮禁售英特尔至强Phi,2019年把国家超算深圳中心、中科曙光这些列入实体清单禁售相关技术,2021年把E级超算技术列入出口管制,2022年直接禁了高端GPU还有超算相关的EDA、制造设备。美国算得好好的,全球都走GPU异构路线,只要把GPU掐了,我们肯定碰不到E级的边。没想到我们根本没按他的预设走,绕开GPU搞纯CPU内嵌加速,效率反而比GPU异构还高。

“打架”,分配任务传数据都不能乱。这套调度逻辑和5G基站协同是通的,华为能搞定几万座基站的调度,放到几万颗CPU上反而更顺手。

打开网易新闻 查看精彩图片

美国自己反而被GPU的红利绑住了,舍不得放弃已经成熟的异构路线,效率一直上不去,守了六年的榜首就这么被我们掀了。这次我们选在德国汉堡的会场公布结果,位置选得也很有说法,欧洲本来就是中美都在争取的中间地带。明着给美国看,四轮封锁全没用,我们自己蹚出一条新路还比你快。转头给欧洲看,我们已经全栈自主,之前中法在气候模拟、天文观测上的超算合作,以后还有更大空间。

打开网易新闻 查看精彩图片

之前还有人挑刺,说灵晟在HPL混合精度测试排第四,是不是AI性能有短板。其实真不是这么回事,灵晟的定位就是先保双精度性能,我们日常用超算做的大气海洋模拟、材料研究、脑科学研究,全都是需要双精度的。内嵌的AI加速单元本来优先级就靠后,而且灵晟本身就是按超智融合方向设计的,后续加上国产昇腾加速卡就能补上AI性能,现在只是留好口子适配更多场景,根本不是卡壳。

现在灵晟已经落地了不少实打实的应用,早就不是摆着看的跑分机器。之前做1公里分辨率的全球地球系统模拟,得排美国超算的队,至少等半个月才能轮上,现在我们国内自己就能跑。去年华北防汛的洪水演进模拟,之前要借欧洲的超算排一周,灵晟三天就能出结果,给防汛抢出了宝贵时间。十万亿级化合物虚拟筛选、一亿原子的第一性原理计算,平均扩展效率达到84.4%,全都是能落地的生产力。

打开网易新闻 查看精彩图片

之前不少人唱衰,说美国卡了高端GPU,中国超算根本造不出E级。现在灵晟219亿亿次的性能摆在这儿,直接把这种论调拍得死死的。美国本来想当拦路虎,结果站在那儿看着我们登顶,还给全球超算圈开了一条全新的赛道。搞不好以后纯CPU内嵌加速会变成新的主流,美国反而得跟着我们的路走。

参考资料:中国互联网新闻中心 刷新世界算力新高度 “灵晟”问鼎全球超算TOP500