打开网易新闻 查看精彩图片

多智能体自组织的工作流:一个分身负责拆解任务、定计划,其余分身共用同一份台账接力把活干完。

最近有篇新研究在 AI 圈子里传开了。有人发现,给一个小模型套上一套自组织的 harness,不用重新训练、不用针对考题调参,就能在编程基准上追平甚至反超那些贵得多的旗舰大模型,而账单只到对方的十分之一左右。这事儿听着像噱头,但数字摆出来,还真有点门道。

这套 harness 到底干了啥

说白了,它是一种训练免费的多智能体编排法。同一个模型开出几个分身,通过一个共享文件来分工:一个分身当调度者,把难题拆成小步、写下计划和笔记;其余分身照着台账去写代码、改答案。谁干到哪了、踩了什么坑,全记在同一份文件里,下一个分身接着干。

研究者管这套共享文件叫 ledger(台账),靠它做零样本自组织。好处是过程透明、可复盘,也不挑模型,拿手头的开源权重就能跑。

数字说出来才服人

测试用的是 LiveCodeBench Hard 里最新的 100 道高难编程题。

最扎眼的一组:用 harness 编排过的 Qwen3.8 Flash Next,pass@1 拿到 93.0%,而某旗舰闭源模型单次调用是 90.4%,成本却只有它的 9%。

更狠的是本地部署的开源 Qwen3.8-27B:裸跑只有 69.2%,套上 harness 一路冲到 92.4%。这波后来居上,靠的是把活儿拆细、接力着干,跟堆多少参数没关系。

整组九个大模型里,最高提升达到 23.2 个百分点。换个组织方式,小模型也能打出接近旗舰的准头。

增益真实,但也有前提

增益是真实的,但也是有条件的。有的模型几乎没变化,甚至更差,比如某款 35B 模型关掉推理后反而掉了 1 到 9 个点。所以别把它当成万能药。

代价也得算清:跑一个调度者,token 账单大概要翻三倍。但它比直接换更大的模型便宜得多。论文里那组账很说明问题,GPT-5.6 一档的模型加 harness,准头接近旗舰单次水平(85.0 对 87.4),价格却只有五分之一,每百题从 61 美元出头降到 11 美元多;开源权重自己托管,百题也只要 51 美元出头。

机制上,增益主要来自两处:一是上下文管理,短调用加共享笔记减少了截断,二是问题拆解本身。

普通开发者能学到什么

这套打法给普通人的提醒挺实在:想用 AI 写代码,与其一味等更大的模型、追更贵的账单,不如先把手上的模型组织好。小模型配好 harness,性价比往往比硬上旗舰更划算。

这背后的道理,见微知著:决定效果的,常常不只是用什么模型,还有怎么让模型协作。想省钱又想拿好结果,得真刀真枪地把这套流程搭起来,而不是停在观望。

对中小团队和个人开发者来说,这是一条更够得着的路:不依赖最贵的闭源接口,靠开源权重加一套编排,就能摸到前沿水平的边。

原文链接:https://www.reddit.com/r/Qwen_AI/comments/1wi3anr/qwen_38_flash_next_with_a_harness_outperforms/