打开网易新闻 查看精彩图片

火箭回收的公开讨论,大多集中在控制算法、着陆腿结构、发动机推力调节这些看得见的环节。但真正让工程师头疼的,往往是另一件事:33台发动机同时向下喷火时,箭尾那团谁也看不清的超声速尾焰。

今年10月,西安交通大学AI4S团队依托曙光8000异构计算平台,完成了33喷口火箭发动机阵列的超声速尾焰数值模拟,计算规模6.774万亿网格单元。研究团队将其表述为“已知规模最大的超声速时空耦合高精度射流仿真案例”。

打开网易新闻 查看精彩图片

这个数字本身不稀奇。真正的问题是:为什么非要算这么大?算出来之后能替代什么?

火箭回收时,发动机反向喷流与来流形成复杂激波结构。多台发动机的尾焰在箭尾相互干涉,产生“底部加热”效应,高温燃气回流到箭体底部,威胁结构安全。有研究显示,三台发动机同时工作时,羽流间的交互会导致局部热流峰值达到380千瓦每平方米。

工程难点在于:你无法在地面上完整复现它。风洞试验可以模拟单一喷流特性,但33台发动机同时工作、尾焰相互干涉、来流马赫数从高超声速到亚声速连续变化,这些条件在地面试验中几乎不可能同时满足。火箭返回时发动机反向喷流的气动力热实验数据“与理论计算相去甚远”,“迫使后续设计中对控制系统及防热做了大幅度改进”。

测点有限,是地面试验的另一个硬约束。箭体底部的传感器数量受限于空间和布线,能采集到的数据是离散的、局部的。而尾焰干扰的全貌,激波在哪里交汇、回流从哪里进入、热流峰值出现在哪个位置,需要的是连续的、全场的数据。这就是6.774万亿网格的意义:它不是在算一个更大的数字,是在把地面试验测不到的那部分流场画出来。

打开网易新闻 查看精彩图片

十万卡级集群的工程难题,业内有一个共识:核心瓶颈从来不是硬件峰值算力。显存带宽、跨节点通信开销、算法与硬件的适配矛盾,每一项都足以让一堆昂贵的加速卡变成高性能的摆设。

曙光8000在这次任务中交出的数据是:弱扩展效率99.01%,并行规模扩大四倍、总网格量同步增加四倍时,平均单步耗时仅增加约1%。强扩展效率73%,四倍资源投入获得约2.92倍加速。这两个数字的技术含义需要区分。弱扩展衡量的是每张卡的负载不变时,增加卡数后单卡效率能保持多少。99%意味着几乎线性扩展。强扩展衡量的是问题规模不变时,增加卡数能带来多少加速。73%意味着四倍资源换来2.92倍加速,存在一定通信开销。在通信密集型的CFD计算中,这两个数字都是不错的成绩。

但这不是“国产算力已经追上国际水平”的证据。据公开分析,国产旗舰单卡FP16算力目前集中在数百TFLOPS到数PFLOPS区间,与国际领先水平仍有差距。数量堆规模、架构补单兵,是国产路线的核心逻辑。这次突破的意义不在于单卡多强,在于万卡级协同的效率有多高。

传统上,火箭回收的防热设计依赖地面试验。但地面试验有两个无法回避的约束:成本极高,测点极有限。一次全尺寸火箭复用关键技术验证飞行试验,涉及变推发动机点火、箭体受控下降、着陆腿展开等多个环节,单次成本以千万级计。数值模拟能做的事是:在试验之前,先画出一张全场流场图。哪里热流最高、哪里压力脉动最大、哪些区域需要重点监测,这些信息可以指导试验测点的布置,让有限的传感器放在最需要的位置。研究团队也明确表示,这套体系“可以提取结构表面压力及其时间历程,分析局部峰值与载荷分布,辅助确定试验测点”。

打开网易新闻 查看精彩图片

但模拟不能替代试验。它提供的是先验知识,不是最终验证。防热设计的最终确认,仍然需要真实飞行数据来校准。

这个边界需要说清楚。欧洲空间局的RETPRO项目在做类似工作,美国乔治亚理工学院的团队在OLCF Frontier和El Capitan超算上完成了33台发动机排气流相互作用的模拟,模拟了200万亿网格点和1000万亿自由度,比之前的记录高出20倍。全球在这个方向上的投入是持续的、竞争性的。中国的这次模拟,是在同一赛道上的一个节点,不是终点。

这次任务中有一个容易被忽略的技术细节:西安交大团队针对曙光8000的硬件特征,对计算方法做了优化。传统CFD计算多采用多阶段龙格库塔算法,每一步都要反复读写全场数据、交换边界信息。在数万卡规模下,这种反复的数据搬运是效率杀手。团队利用WENO-GKS方法的时空耦合特性,采用单步时间推进,把多阶段反复读写转化为界面局部计算,大幅削减了显存读写频次和跨节点通信量。这比堆卡更有信息量。它说明大规模科学计算的成功,不完全取决于硬件性能,还取决于算法能否针对特定硬件架构进行重构。

打开网易新闻 查看精彩图片

国产算力生态目前面临的核心问题之一,正是算法迁移和适配。北京大学李新亮团队完成的OpenCFD-SCU程序从Fortran+MPI到C+MPI+CUDA/Hip的移植,说明“CFD的GPU加速不只是把循环放到GPU上,需要重构算法、数据结构、内存访问模式和通信拓扑”。每一步都是工程量的积累,没有捷径。曙光8000这次任务的价值,部分在于它验证了国产硬件加适配算法的耦合是可行的。这个验证本身,比6.774万亿这个数字更有持续性意义。

火箭回收的尾焰模拟,本质上是一个把不可见变成可见的工程问题。6.774万亿网格的数字,反映的是国产算力平台在真实科研任务上的稳定输出能力,以及在通信密集型计算中维持效率的能力。

但这个突破的边界同样清晰:单卡性能与国际先进水平仍有差距;模拟不能替代试验,防热设计的最终确认仍然依赖真实飞行数据;算法与硬件的深度适配需要持续的工程投入,不是一个平台的成功就能一劳永逸的。

打开网易新闻 查看精彩图片

真正值得关注的,不是国产算力拿下了什么,而是这套能力接下来会被用到哪里。研究团队给出的路线图是:近期围绕多发动机尾焰干扰积累验证数据,中期开展智能建模,应用对象从重型运载火箭拓展到着陆器喷流干扰和高速飞行器外流问题。这些方向都是高超声速飞行器和可重复使用航天器设计的共性难题。

6.774万亿网格算的是尾焰,验证的是国产万卡集群在通信密集型计算中能不能稳住效率。这个验证比网格数本身更有用。接下来要看的是这套能力会不会被用来算别的,比如高超声速飞行器的外流,或者着陆器的喷流干扰。如果明年这些方向上还有类似的模拟出来,那说明曙光8000不是只跑通了一个案例。