打开网易新闻 查看精彩图片

从天气预报、地震勘探,到电磁仿真、材料模拟……现代工业与前沿科研的每一次突破,都离不开规模庞大的高性能计算(HPC)软件。

在这些软件的底层,均有一个极度消耗算力、却又无法避开的核心计算模式——Stencil(模块计算),其核心是对规则网格上每个点及其固定邻域执行相同局部运算。

无论是大气动力学、地震波场传播、电磁场演化,还是流体力学与相场模拟,其底层的计算都可以归纳为同一种操作:用网格点邻居的加权组合,反复更新整个网格。这类计算访存密集、受内存带宽主导,往往占据整个应用的大部分运行时间。

因此,Stencil的性能高低,直接决定了国家关键工业与科研软件的整体效率。

但如何将一个Stencil优化到硬件的物理极限?

过去一般是依靠极度稀缺的高性能计算(HPC)专家。

他们开发了大量面向Stencil的编译器、代码生成器和自动调优系统,能自动生成代码、自动搜索参数配置,但本质上这些自动化工具背后的优化算法都需要人来设计和集成,面对新的应用场景、新的Shape和新的硬件平台,研究人员仍需不断提出新的优化策略,并手工将成果接入真实应用。因此,Stencil优化始终高度依赖专家经验、难以规模化。

现在,这一局面有望被彻底改写——

今天,面壁智能联合OpenBMB开源社区发布并开源了全球首个支持Stencil自动研究、自动部署的AI优化系统——ForgeStencil。

据统计,ForgeStencil在一周内完成了100+个真实工业和科学计算软件的自动优化,远超人类专家的优化速度。这意味着,Stencil优化的规模化成为可能;AI加速千行百业、推动国产「智造」升级,正在成为现实。

双Agent驱动:零人工介入

ForgeStencil之所以能超越以往所有的自动调优工具,关键在于:它首次实现了从「提出优化想法」到「应用无缝部署」的全自动闭环。

在整个过程中,人类只需要提供待优化的应用源码,后续全流程由ForgeStencil接手——从自动分析真实应用、定位热点函数、锻造Kernel,到完成算子替换、正确性验证与集成回原应用,全程没有人类专家介入任何一步优化决策。

ForgeStencil系统由KernelAgent与AppAgent组成,二者结合完成了从算子优化到应用部署的完整闭环,不止是优化单个Kernel,更是优化整个应用:

KernelAgent:算子锻造的「科学家」

它专注于自主研究并合成高性能Kernel,针对主流Stencil类型、多种Shape与精度要求,自主构建专用算子矩阵,将Stencil算子的数学表达写成逼近硬件物理极限的优雅代码。

在算子测试中,ForgeStencil与目前市面上开源的最优算法(包括Halide、Devito、EBISU、DRStencil、FlashFFTStencil等知名框架)在同等硬件下进行对比测试,展示了强劲的技术优势:

  • 同精度(fp32)对比下,获得了几何平均2.35×的加速比;
  • 混合精度(fp16)读写时,又拿下了额外的1.95×提速;
  • 即便在业界公认最难的「变系数Stencil」全部Shape上,相比最优基线仍取得几何平均下1.34×的加速。

AppAgent:应用部署的「实干派」

不同于干净、理想化的Benchmark测试环境,现实世界中的科学计算算法往往不是标准的Stencil循环,从输入输出形式到计算流程都与具体应用紧密相关。因此,传统的静态算子库通常无法直接融入真实软件。

AppAgent的做法是为每个应用单独锻造方案:定位性能热点、建立应用自身的GPU基线、锻造候选优化、用程序自带的校验与计时验证、再集成回原应用。

在框架级,AppAgent寻找算子融合的机会,并把待优化的Stencil算子提取出来。KernelAgent则负责优化具体的算子,其在之前建立的算子矩阵被作为后续开发的知识库。最终,AppAgent会使用应用自带的测例做端到端评测,以确保优化面向真实场景。

ForgeStencil是面壁智能基于ForgeEngineering(旨在推动智能进化效率的全新软件工程范式)研发,继5月「AI制造AI」成果ForgeTrain之后所取得的又一重大技术突破。

通过KernelAgent(理论发现)与AppAgent(工程落地)的闭环协同,ForgeStencil成功实现了从「自动生成代码」向「自动研究优化」、从「局部算子提速」向「真实应用部署」的智能进化。

100+真实软件优化,仅需1周

在过去,一位HPC专家要优化一个真实的工业软件或科学计算应用,需要进行性能瓶颈分析、软件架构理解、Stencil模式识别、优化方案设计、高性能Kernel开发、正确性验证、应用集成……整个流程历时数日到数周,每人每年能精调的应用软件通常不超过20个。

但在大模型时代,这一研究规则被改写了:

据统计,ForgeStencil完成100+真实应用软件的自动优化,仅用了1周——单应用优化时长被压缩到小时级别,研发吞吐提升约1–2个数量级,研发效率提升约100倍,且可以随着算力规模的加大并行放大。

这也意味着,Stencil算子的优化,及其所决定的工业软件和科学计算应用优化,打破了过去人力的限制,首次实现规模化的可能性,能够有力加速国产「智」造的进程。

打开网易新闻 查看精彩图片

目前,ForgeStencil已在一批主流科学软件与权威基准上完成自动优化,并在应用自带的GPU实现之上取得真实的端到端加速,其中约42%直接对应真实工业生产软件场景。

这也是ForgeStencil的差异化之处:它不仅停留在榜单上,而是直接面向真实工业场景,优化目标直接服务于石油公司、医疗设备、气象部门等行业的实际生产。

这些工业生产中的应用包括:

  • hypre(LLNL结构化多重网格求解器库,加速3.86×):全球工业仿真最广泛依赖的生产级数值库之一,ForgeStencil自己搞定了高难度的红黑GS光滑子访存合并优化
  • minisweep(Sn离散纵标输运,核反应堆中子学,加速5.78×):设计核反应堆核心计算的必需品,ForgeStencil重构了极其复杂的KBA波前扫掠结构。
  • gprMax/FDTD(Yee网格Maxwell电磁仿真,加速2.47×):雷达和芯片电磁仿真的骨干,ForgeStencil完成了电磁装备与探地雷达的核心Stencil核替换。
  • RTM逆时偏移(油气地震成像,加速1.81×)。
  • TOTALE&Pminimod(道达尔油气地震mini-app,加速1.22×):石油勘探的主力算法。
  • QuantLib债券定价(量化金融,加速1.82×):金融机构所使用的定价库。
  • FHd非笛卡尔MRI重建(加速2.45×):医学影像软件。
  • DBT数字乳腺断层成像反投影(加速1.63×):医疗设备中的重建与成像负载。

打开网易新闻 查看精彩图片

与人类专家优化相比,AI优化的另一技术优势在于:

人类专家的经验都在自己脑子里,很难共享给别人;但ForgeStencil有大量并行的Agent共享知识库,经验可以实时共享,可以实现智能的集体同步进化。

助力国产工业软件性能突围

ForgeStencil旨在为工业软件和科学计算应用带来全新的研发范式。

短期内,存量软件的自动优化可以带来直接的收益。已有的以Stencil为热点的工业或科学软件,能在小时级拿到接近硬件极限的实现。通过算力节约和研发时间的压缩,助力工业和科研的降本增效。

长期来看,ForgeStencil为国产制造业升级按下了「加速键」。

Stencil算子背后的应用包括CAE仿真、地震成像、电磁与流体计算等等工业软件——它们是高端装备、能源勘探、芯片设计的数字底座,当这些软件的性能优化被自动化后,国产制造业的发展也会进入快车道。

从ForgeTrain到ForgeStencil,面壁智能坚信ForgeEngineering是未来的软件研发新范式。目前,ForgeStencil已开源,我们诚邀广大HPC学者、工业软件从业者和开源社区开发者共同参与,携手用AI锻造更高效、更自主的计算未来。