MaaS 业务里,模型在换、卡型在换、请求工况也在换。今天调好的部署配置,下周可能就不是最优解了。
麻烦的地方在于,传统推理优化是一条纯人工链路:需求分析、性能定位、算子开发、验证、上线,每一步都要人盯着。优化周期很难跟上生产负载的变化速度。
阿里巴巴高级技术专家杨林枫将在 QCon 上海站分享一套面向 MaaS 生产场景的自动优化流程。他长期从事 AI 软件栈、AI 编译与算子编译工作,是开源 AI 框架 MindSpore 核心贡献者,曾主导昇腾算子编译器 SWFT 的设计与研发,目前是 Atrex Kernel Agent 核心研发者。
先探部署配置,再谈算子
这套流程的起点不是算子,而是部署配置。
给定卡型、模型和典型工况,先探索并行策略、批处理及推理引擎配置,再结合延迟、吞吐、显存和资源成本,选出候选部署方案。之后根据实际运行 Trace,定位当前部署配置下的主要性能瓶颈。
这一步的顺序很关键。单算子 Benchmark 的优化结果,不一定能转化为端到端收益。如果先埋头优化算子,很可能优化了一个不是瓶颈的环节。
从生产 Trace 里识别热门算子之后,还要做几件事:归并动态 Shape,选取典型 workload,结合卡型、模型、工况和算子 Trace,判断是否采用已有的算子融合模式。
线上 Trace 不能直接当 Benchmark 用。生产工况需要经过去重、清洗、脱敏和泛化,才能形成可复现的 Benchmark,并建立正确性、数值容差和性能评测标准,确定算子任务的优化优先级。
Agent Loop 负责优化,外围 Loop 负责兜底
Atrex Kernel Agent 通过 Agent Loop 完成多轮算子优化:profile、瓶颈分析、方案生成、代码修改、验证、复盘,循环推进。
多轮优化需要管理。这套流程用隔离会话、Git worktree、结构化 memory 和实验 journal 来管理优化过程。外围 Loop 则负责实验预算、状态恢复、正确性门禁和终止控制,并使用完整 workload 与同卡 ABBA 测量验证性能收益。有效方案和失败实验都会被记录下来。
Agent 在这里有两个已知风险:可能过拟合公开 Shape,也可能把 GPU 测量波动误判为性能收益。外围 Loop 的正确性门禁和测量验证,针对的正是这两类问题。
优化完成后,算子要回接推理框架,检查接口、依赖和硬件兼容性,进行算子正确性与性能回归,以及模型端到端性能验证。最后通过灰度发布观察实际效果,并保留异常回滚能力。
Kernel 局部变快,不代表端到端一定有收益。所以最终判断标准,仍然要回到推理框架和模型层重新验证。
实践中的几个痛点
生产工况变化快,还存在长尾。采样过少可能遗漏重要场景,采样过多则会增加分析和评测成本,这个平衡不好找。
自动生成的代码在进入生产环境前,仍需经过正确性验证、性能回归、灰度发布和异常回滚。这条链路没有因为引入 Agent 而缩短。
相关实践支撑阿里百炼 MaaS 大规模 GPU 集群的性能优化,也支撑 Qwen3.8 获得 NVIDIA SOL-ExecBench FlashInfer 算子优化榜首。
杨林枫的分享会重点介绍算子优化,以及各环节之间如何衔接。对于正在做推理优化的团队来说,这套流程里值得关注的不是 Agent 本身,而是它被放在了哪个位置——从生产 Trace 生成优化任务,再把结果放回框架验证,中间每一环都有明确的验收标准。
2026 年 QCon 全球软件开发大会 · 上海站将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等方向展开。大会共策划 20 个专题论坛,将有 100+ 资深专家在现场分享一线实践经验。
热门跟贴