打开网易新闻 查看精彩图片

当大模型开始自动生成、验证和优化核算子,也开始反哺算力,从算力的消费者,变成算力效率的生产者。

作者丨吴海明

编辑丨岑 峰

近年来,大模型正在从生成内容、生成代码,走向自动做实验、读取反馈、迭代系统。今年以来,Andrej Karpathy 开源的 Autoresearch 吸引了大量关注,把一个小型 LLM 训练任务交给智能体:修改训练代码,运行固定时长的短实验,读取验证指标,保留有效改动,再进入下一轮尝试。

类似的变化也正在进入更底层的 AI 基础设施,大模型训练和推理中的矩阵乘法、注意力机制、归一化、激活函数、算子融合等计算,最终都要落到具体核算子(kernel)上执行;而在芯片运算过程中,核算子决定这块芯片到底能被用到什么程度,一个高性能核算子能直接影响推理延迟、训练吞吐、硬件利用率和部署成本。

打开网易新闻 查看精彩图片

随着大模型规模继续扩大,行业对算力的讨论已经不再只停留在有多少 GPU峰值算力是多少,更关注这些算力能不能被稳定、高效、低成本地转化为真实系统性能。

自动核算子生成正在成为回答这个问题的一条新路径,让模型根据高层计算描述自动生成底层核算子代码,再通过自动化编译、运行、数值校验、性能测试和性能分析(profiling)筛选出可用实现。和普通代码生成相比,它不仅要求能跑,还要求在真实硬件上跑得足够快。更准确地说,自动核算子生成是一种面向性能的程序合成:模型写出适配硬件的核算子代码后,还要根据执行反馈不断修改实现,逐步逼近更高的硬件利用率。

近日,北京智源人工智能研究院等机构在 IJCAI 2026 发表综述论文《Towards Automated Kernel Generation in the Era of LLMs》。论文系统梳理了大模型时代自动核算子生成的技术版图,讨论如何让大模型参与 CUDA、Triton、ROCm、AscendC 等后端核算子的生成与优化,把过去高度依赖少数系统工程专家的性能调优,转化为可自动生成、验证和迭代的系统能力。

这不仅是一篇学术总结,更是一份“AI 制造 AI”的底层路线图。这篇论文正式宣告,大模型正在从算力的“消费者”,演变为算力效率的“生产者”。

打开网易新闻 查看精彩图片

论文基本信息

论文标题:Towards Automated Kernel Generation in the Era of LLMs

论文链接:https://ijcai-preprints.s3.us-west-1.amazonaws.com/2026/SV28.pdf

GitHub 地址:https://github.com/flagos-ai/awesome-LLM-driven-kernel-generation

01

核算子:

决定芯片利用率的“最后一公里”

过去几年,大模型训练和推理持续推高硬件需求,GPU、NPU 等加速器成为 AI 基础设施的核心资源,但在真实系统里,硬件峰值性能和业务可感知性能之间,往往隔着一整套软件栈,核算子就在这条链路的底

在 PyTorch 里,attention、LayerNorm、RMSNorm、GEMM、softmax 等算法往往只是几行高层代码;到了硬件执行层,它们会被翻译成具体核算子,在不同线程、寄存器、缓存、显存访问路径和指令单元之间调度。写出能跑的核算子并不难,难的是让它在特定硬件、输入形状、精度和工作负载下都足够

这也是核算子工程昂贵的原因,优秀的核算子工程师需要同时理解算法、硬件架构和编程模。CUDA、Triton、ROCm、AscendC、CUTLASS、TileLang 等工具链各有抽象方式和优化策略;同一个算子在 NVIDIA GPU、AMD GPU 或 Ascend NPU 上可能需要不同实现,即使同一实现,在不同 batch size、sequence length 或精度设置下,性能也可能明显变化。

对国产算力生态而言,这个问题更加关键。国产 GPU/NPU 要支撑大模型训练和推理,除了硬件进步,也需要算子库、编译器、框架适配和运行时系统共同成熟。自动核算子生成的价值正在于此:把专家经验放大成可规模化的软件生产力,让新硬件、新模型和新工作负载的适配更快

02

大模型如何参与底层性能优化?

在大模型出现之前,业界并不是没有自动化工具,Halide、TVM 等编译系统,以及 CUDA、CUTLASS、Triton、TileLang 等开发工具,已经显著降低了核算子开发和调优门槛。但传统自动调优非常依赖人类专家提前设计搜索空间、调度原语和优化规则,系统只能在既定路线里搜索更好的参数,却很难发现没有被写进搜索空间的优化策略。

目前,大模型和智能体系统(agentic system)带来了新的可能性。大模型从海量代码、文档、开源算子库和工程实践中学习硬件相关的编程知识,理解高层计算语义如何映射到底层实现;智能体则把编译、运行、正确性验证、性能测试和性能分析接入迭代过程,让模型在真实硬件反馈中持续修改。

这使核算子生成更像一套面向性能的程序合成流程:生成候选实现,编译,运行,验证数值正确性,测量性能,分析瓶颈,再生成下一版。

近期,斯坦福 KernelBench、NVIDIA 关于 GPU 核算子自动生成的实验,以及一系列结合强化学习、性能分析、多智能体协作和演化搜索的研究,都在推动模型进入底层性能工程。这些工作共同指向一个变化:大模型不再只是算力的消费者,也开始参与优化算力本

02

定义大模型驱动的“程序合成”流水线

目前,大模型驱动的核算子生成正处于快速增长但相对分散的阶段,不同团队分别从 CUDA、Triton、AscendC、ROCm 等不同硬件平台的后端切入,方法覆盖监督微调、强化学习、智能体工作流、性能分析、外部记忆、基准设计和数据集建设。因此,论文的目标是将这些零碎进展整理成一张较完整的技术地图,包含四个核心部分:面向核算子生成的大模型训练、面向核算子优化的智能体系统、数据集与知识库、评测基准。

打开网易新闻 查看精彩图片

第一部分是模型训练,相关工作试图让模型从会写核算子,走向会优化核算子,主要路线包括监督微调和强化学习。

监督微调主要依赖高质量的 PyTorch-CUDA、PyTorch-Triton 或其他高低层实现对齐样本,让模型学习计算意图和底层实现之间的映射。KernelLLM、ConCuR、KernelCoder、InCoder-32B 等工作都围绕这个问题展开:通用代码能力并不足以支撑高性能核算子生成,模型需要专门的核算子数据、指令格式和优化知识。

强化学习则把正确性、运行速度和性能分析转化为 reward,让模型在执行反馈中提高生成质量。论文沿 CUDA 和 Triton 两条路线梳理了相关进展,包括 CUDA Agent、AutoTriton、TritonRL、QiMeng-Kernel、Dr. Kernel、Kernel-Smith 等,它们共同说明,核算子生成已经不再只是生成一段能编译的代码,而是在用真实运行结果训练模型的优化能力。AscendKernelGen 等工作也把这一范式扩展到 Ascend NPU,显示出自动核算子生成正在从 CUDA 生态走向更多硬件后端。

打开网易新闻 查看精彩图片

第二部分是智能体系统,单次代码生成很难解决核算子优化问题,多轮执行反馈才是更接近工程实践的路径。智能体可以拆分规划、代码生成、调试、性能分析、结果评估等任务,也可以通过外部记忆保存历史优化经验,一个强核算子智能体的能力,取决于模型参数,也取决于它能否读懂硬件反馈、复用工程知识,并在多轮试错中逐渐逼近更优实现。

论文把智能体系统进一步拆成几类机制。早期方法主要依赖生成-运行-报错-修复的反馈循环;后续工作开始引入更系统的搜索、演化和多智能体协作,PEAK、AutoKernel、MaxCode、K-Search 等方法强调搜索与优化策略,FM Agent、EvoEngineer、GPU Kernel Scientist、cuPilot 等工作引入种群和演化机制,STARK、AKG、Astra、CudaForge、KForge、KernelFalcon、GEAK 等方法则把核算子开发拆成多个角色或阶段。

这类工作背后的判断很清楚:核算子开发不是单一能力任务,它同时需要算法规划、代码生成、编译调试、性能分析和结果评估,更像一个小型工程团队在协作。智能体的价值一方面是替人写代码,另一方面在于把这些步骤组织成可重复、可记录、可扩展的优化流水线。

打开网易新闻 查看精彩图片

第三部分是数据集和知识库,高性能核算子数据天然稀缺,因为它并非普通代码,还包含硬件 intrinsic、并行执行语义、内存层级、数值稳定性和平台约束,论文总结了从 The Stack v2、HPC-Instruct、KernelBook、KernelBench samples,到 CUTLASS、FlashAttention、xFormers、bitsandbytes、FlashInfer、DeepGEMM、PyTorch ATen、vLLM、SGLang、TensorRT-LLM 等开源资源。这些资源大致可以分成三类:一类是面向模型训练的代码和指令数据,帮助模型学习高层计算意图如何对应底层实现;一类是高性能开源算子库和推理系统代码,让模型接触真实工程里的优化模式;还有一类是 CUDA Programming Guide、PTX ISA Reference、NVIDIA Architecture Tuning Guides、Nsight Compute 文档,以及 GPU-MODE、Triton Index、Awesome-CUDA、LeetCUDA、Triton-Puzzles 等社区资料。

从数据角度来看,代码只是其中一部分,很多优化经验并不直接写在最终版本的 kernel 里,而是散落在硬件文档、调优指南、社区讨论和工程师的历史决策中。未来强大的核算子智能体不会只依赖模型参数本身,还需要持续积累训练数据、工程知识和历史性能分析。

打开网易新闻 查看精彩图片

第四部分是评测基准,自动核算子生成能否成为基础设施,关键在于能否被可靠评测。一个核算子首先要正确,但正确只是起点,还必须足够快,并在不同输入形状、不同硬件和真实系统场景中保持稳定收益。

论文将评测指标分为正确性、性能和综合质量。正确性要求生成核算子在数值容差内与参考实现一致;性能关注 runtime、speedup、硬件 Speed-of-Light 目标,以及 fastp 这类指标,即统计有多少比例的核算子既正确,又超过给定加速比。相比单纯看平均速度,fastp 更能反映模型稳定生成又对又快核算子的能力。

现有评测基准也在快速演进。ParEval、KernelBench、TritonBench、MultiKernelBench、ROCm Benchmark、Robust-kbench、BackendBench、CUDAEval、FlashInfer-Bench、SOL-ExecBench 等基准,分别覆盖通用并行代码、AI 核算子、Triton 算子、多平台后端、鲁棒性、真实推理任务和硬件上限评估。评测正在从单点速度比较,走向多平台、鲁棒性和真实系统收益。

打开网易新闻 查看精彩图片

从行业意义来看,这篇综述回答了一个更基础的问题:在核算子优化成为 AI 基础设施之一时,需要哪些模型、数据、工具、评测和执行环境共同支撑。

04

未来竞争会落到数据、反馈和基础设施

论文对未来方向也做出了判断:自动核算子生成已经证明了方向可行,但距离稳定部署还有不少问题

1.评测,现有模型/系统即使在评测基准上取得很高分数,也未必能在真实部署环境中带来同等收益,可能过拟合固定输入的形状,也可能只针对某个硬件环境调参。未来评测需要从这个核算子是否更快走向完整系统是否更快、更稳、更便宜

2.数据,在实际开发场景中,很多高性能核算子只保留最终代码,缺少优化过程。对模型更有价值的往往是中间轨迹:初版为什么慢,性能分析暴露了什么瓶颈,哪些修改有效,哪些尝试失败,为什么某个版本数值不稳定,这些由编译、运行、性能分析和调试组成的优化记录,可能会成为未来训练核算子智能体的关键数据资产。

3.智能体能力,核算子优化是长周期、多步骤、强反馈的工程任务。未来的智能体需要更好地管理上下文,规划多步优化路线,根据失败原因调整策略,并把最终性能提升归因到前面某个具体决策。

4.执行基础设施,自动核算子生成不同于普通文本/代码生成,每个候选核算子都要真实编译、运行、验证和计时。强化学习、演化搜索和大规模数据生成都离不开高吞吐、可隔离、可复现的执行环境。没有稳定的 harness,模型很难持续获得高质量反馈。

5.人机协作,自动核算子生成短期内并不意味着完全替代专家。更现实的路径是由人类专家给出目标、约束和工程判断,智能体负责大规模探索候选实现,再把编译结果、性能数据和可行优化方案反馈给人类。由于核算子的正确性和性能可以通过执行验证,这个方向天然适合持续迭代。

05

FlagOS 视角:AI 系统底座的算子环节

智源的工作看,自动核算子生成并不是一个孤立议题,与 FlagOS 面向 AI 系统底层能力建设的方向一致:围绕模型、算子、编译、运行时和异构硬件适配,构建更完整的软件基础设施。今天的大模型竞争,表面上是模型能力竞争,背后也是系统效率竞争,一个模型能否低成本部署,能否在不同硬件上稳定运行,能否把底层算力真正用起来,往往取决于模型之外的系统能力。

自动核算子生成正处在这条链路上,连接高层模型和底层硬件,也连接算法创新和工程落地。对研究者来说,它提供了一个新的性能优化范式;对工程团队来说,它可能降低核算子开发和硬件适配成本;对国产算力生态来说,它有机会加速软件栈成熟,让新硬件更快进入可用、好用的状态。

未来 AI 基础设施的竞争,会同时考验芯片供给和系统效率。谁能更快把硬件峰值转化为稳定、可复用、可验证的系统性能,谁就能在训练、推理和硬件生态建设中获得更大主动权,大模型正在进入这个更底层的战场,自动核算子生成可能会成为其中最关键的能力之一。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。