调提示词这件事,多数人的做法是改一版、跑几轮、看结果、再改。微软一篇新论文给出了另一条路:把Agent跑过的旧日志直接交给一个普通编码Agent,让它写代码去统计每一次运行里发生了什么。
核心结论很直接:在同样的日志条件下,编码Agent写出的提示词,在4个Agent基准测试里有3个击败了调优工具GEPA,每条提示词的成本约1.6美元。
调优工具的盲区在哪
常见的提示词调优工具有一套固定流程:微调提示词,重新跑Agent,然后根据少数几次运行的结果判断这次改动是好是坏。
问题就出在"少数几次"上。样本太少,偶发情况会被当成规律,反复出现的错误反而可能被漏掉。论文绕开了这套流程,不重新跑,直接翻旧账。
编码Agent拿到保存下来的日志后,会自己写代码,把每一次运行里的情况都数一遍。统计口径覆盖全部历史运行,那些藏在少数几次试验背后的重复性错误,就这样被翻了出来。
为什么是编码Agent来干这件事
关键在于"写代码统计"这个动作。日志是结构化的记录,要从中找出规律,本质是一次数据分析任务,而不是文字润色任务。
编码Agent擅长把模糊的需求翻译成可执行的统计脚本,跑完再根据结果反推提示词该怎么改。这套路径不依赖反复试错。
论文给出的成本数字是每条提示词约1.6美元。这个价格对应的不是一次盲改,而是一轮基于全量日志的分析。
先翻日志,再谈调优
论文给出的操作建议很务实:先把编码Agent指向你手里已经有的日志,把这一步做完,再去考虑用试错式调优去抠最后那点收益。
顺序反过来,等于在没看清历史数据的情况下就开始改提示词,改动的方向只能靠猜。而日志里其实已经写着你需要的答案,只是需要有人把它统计出来。
对已经在跑Agent的团队来说,这条路径的吸引力在于零额外数据采集——日志本来就在那里,缺的只是把它交给一个会写代码的Agent去读。
热门跟贴