大多数编码Agent的底层架构是静态的。能力在设计阶段就被焊死,运行过程中没有任何机制能改变执行方式。华为开源的openJiuwen,就是冲着这个痛点去的——它把Agent的"运行方式"本身变成了可调整的变量。

结果相当能打:在SWE-bench Verified上拿到82.6%,在Terminal-Bench 2.1上拿到87.19%,分别比官方榜单最强成绩高出3.43.39个百分点。更关键的是,模型策略全程固定——也就是说,这3.4分的提升完全来自harness(执行框架)本身,而不是底下换了更强的模型。

打开网易新闻 查看精彩图片

静态harness的瓶颈在哪

传统Agent跑任务时,上下文怎么组织、反馈怎么给、任务怎么拆解,这些在启动前就定死了。一旦运行中遇到设计时没预料到的情况,Agent只能硬着头皮按原计划走,没有"临场调整"的能力。

openJiuwen的做法是引入Rail-based组合机制。开发者可以在同一个共享执行底座上,自由组装单个Agent、委派子Agent、甚至编排群体协作流程(swarm flows)。这相当于把Agent的"组织结构"从固定架构变成了可插拔模块。

运行中的实时反馈回路

光能组合还不够,openJiuwen的关键在于运行时的动态调整。它从三个维度收集证据:语义诊断(代码逻辑层面的问题)、执行结果(实际跑起来的表现)、任务进度(当前完成到哪一步)。这些实时证据会反过来重塑Agent的上下文、反馈机制和任务控制方式——任务还在跑,但"怎么跑"这件事本身在持续被优化。

打个比方:传统Agent像按固定剧本演戏的演员,openJiuwen则让导演能在拍摄过程中根据现场情况随时改剧本、调机位。

成绩归因:纯粹harness的胜利

论文里特别强调了一点:整个过程中模型策略保持不变。这意味着成绩提升不能归功于模型能力的增强,而是完全由harness的设计带来的。这对行业来说是个有意思的信号——在模型能力逐渐趋同的当下,执行框架的优化空间可能被严重低估了。

论文已发布在arXiv(编号2608.27969),也支持在线对话讨论。对于正在做Agent开发、尤其是被静态架构限制住手脚的团队来说,这份开源代码值得仔细拆解一遍。