作者丨吴海明 曹PP
编辑丨李 娜
免费的 AI Coding Agent,能不能和付费 Codex 在真实工程任务里打得有来有回?过去一年,我们已经习惯了让 Coding Agent 写网页、做应用、修 Bug。但这一次,我们想把它往更底层推一步:让 AI 去优化大模型自己运行时使用的算子。所谓“算子”,可以简单理解为大模型运行时反复执行的一小段底层计算程序。模型每生成一个 Token,都要在 GPU 或其他 AI 芯片上执行大量矩阵计算、注意力计算和数据变换。单个算子看起来很小,但会被模型反复调用。因此,一段高频算子如果能快 10%、20%,最终就可能转化为推理速度、硬件利用率和服务成本上的实际差异。这恰好提供了一种不同于常规 Coding Benchmark 的测试方式:如果 Agent 能够读懂任务、修改算子、适配不同芯片,并最终跑出真实的性能提升,那么它触及的已经不只是应用开发,而是 AI Infra 中一部分真正的工程工作。为了回答这个问题,我们把 AgnesCode + Agnes 3.0 Flash 放进众智 FlagOS 开放计算全球大赛的一道算子优化题:为 DeepSeek-V3 解码阶段使用的底层算子写优化代码,并在 8 款芯片上接受赛事官方自动化评测,同时,选择 Codex + GPT-5.6 Sol 组合作为对照。两组候选者使用完全相同的环境为算子撰写优化代码,最终都提交到赛事官方的自动化评测系统进行评测。
01
一道题:优化 DeepSeek-V3 底层算子
考虑到常见测试任务的数据很可能已经用于模型训练,导致模型本身已经很擅长,因此,在这次测试中,我们直接跳过常见的网页生成、数据看板、文案撰写等常见测试场景,选择让 AgnesCode 直接挑战更接近基础工程的题目:大模型推理算子优化。具体来说,算子是模型算法能运行的基础环节,模型每生成一个 Token,背后都要反复调用矩阵乘法、注意力、归一化、激活函数等底层算子。在单个算子上几个百分点的加速比,往往直接变成推理延迟、显存占用和服务成本的差异。更重要的是,算子优化正在成为 AI 自进化的一部分,过去,优化这类底层代码高度依赖系统工程师手写经验;现在,Coding Agent 开始尝试读任务、写算子代码、跑测试、看报错、再改代码,这是 AI 开始反过来优化自身运行底座的一种工程样本
02
对打 Codex:入口名翻车,但性能结果并不弱
为了更好知道 AgnesCode 的行业水平,我们选择 Codex+GPT-5.6 Sol 组合作为对照组,AgnesCode 则用官方提供的免费模型 Agnes 3.0 Flash 作为后台。我们为两个组合同时提供一个标准化的 Skill,该 skill 提供了赛制的全部信息,例如如何命名每个代码文件、如何在代码文件中命名函数名、写完代码以后要打包等。之后,我们在相同的环境下让两个组合为测试题撰写代码。具体地,我们首先让两个组合在一台含有 NVIDIA 芯片的机器上撰写第一个版本代码,然后再基于这个版本代码撰写适配其他所有芯片的代码。从运行过程来看,AgnesCode + Agnes 3.0 Flash 组合在第二阶段生成代码的时候,首先花费了7分10秒没有给出答案,经过测试人员催促以后,再次经过13分26秒后给出了 针对不同后端调整优化的代码。包括语法、禁用项和文件依赖检查,最终整理提交包,并更新开发记录。整体来看,从编写实现、跨芯片适配,到代码自检、打包和交付,这个组合已经能够围绕一个专业任务推进完整的工作流程。
03
AA榜单揭示Agnes 3.0 Flash 的能力边界
上述测试可以发现,免费的 AgnesCode+Agnes 3.0 Flash 完全可以和付费订阅的 Codex+ GPT-5.6 Sol 打的有来有回,这是个例还是普遍存在呢?对此,我们调取了 Artificial Analysis (AA榜单)公布数据,其中的 Intelligence Index 指标综合考察模型在工作任务、工具执行、编程、复杂推理、知识可靠性与长上下文等方面的表现,为模型的整体水平提供参照,Agnes 3.0 Flash 的得分为 36 分,即为接近 GPT-5.6 Luna(max)的 38 分。这说明 Agnes 3.0 Flash 本身能力已经和主流模型能力不相上下了。
04
免费又不失性能,为 AI 进化带来更多探索空间
通过代码优化测试可以发现,AgnesCode + Agnes 3.0 Flash 已经能自动化生成能被系统验收、能被继续迭代、能在成本上算得过账的交付物。Agent 时代,模型便宜只是入场券,能把任务交到终点才是护城河。换句话说,随着 AI 的发展,用户需要的不再只是生成应用,而是 AI 开始拧紧自己的底层螺丝。从结果看,AgnesCode + Agnes 3.0 Flash 展示了两个信号:1.在有明确工作流、任务文件和评测反馈的情况下,它已经能推进跨芯片算子适配,并在部分芯片上跑出更高加速比。2.Agent 可能会在“最后一公里”犯错,例如入口命名、提交规范、覆盖范围等细节,这些问题不一定抹掉性能亮点,但会直接决定结果能不能被真实系统接收。模型能力决定上限,工作台能力决定它能不能稳定抵达上限。对开发者和企业用户而言,AgnesCode 的优势不只在模型本身,也在它把模型、项目文件、Skill、命令执行和评测反馈组织到同一个工作流里,帮助用户少打扰、少返工、少花钱地把事做完。从算子优化来说,这也是国产 AI 芯片生态正在面对的现实问题,不同芯片之间的差异,不会因为上层框架统一就自动消失;推理框架、算子库、编译工具链和真实业务负载之间,仍然需要大量适配工作。如果 Agent 能进入这条链路,它就有机会把过去依赖少数系统工程师经验的优化工作,变成可以持续生成、持续验证、持续迭代的工程流程。对比,Codex + GPT-5.6 Sol 在任务推进速度和整体流畅度上依然更占优,AgnesCode + Agnes 3.0 Flash 也暴露出交付细节上的不稳定。但同时证明了一件事:免费模型并非只能停留在简单任务层面,只要工具链、上下文和评测闭环足够明确,它同样可以进入专业工作流,并交出有竞争力的结果。免费模型的真正价值,正在从让 AI 变得更便宜转向让更多真实任务有机会被 AI 反复尝试。当试错成本下降,Agent 才可能从“偶尔帮忙”变成“持续干活”;当持续干活成为可能,谁能把专业要求稳定写进执行过程,谁就更接近下一代 AI 工作台的入口。
热门跟贴