CMU 的一篇论文提出了一种叫 harness learning 的方法。核心思路是:不动 solver 模型的权重,转而用强化学习训练一个提案模型,让它去改写 harness 代码。

具体来说,这个提案模型会读取三样东西:任务、当前的 harness,以及执行报告。基于这些输入,它生成对 harness 代码的修改。

打开网易新闻 查看精彩图片

奖励从哪来

修改后的 harness 会被拿去执行,执行得分直接作为奖励信号。也就是说,提案模型优化的目标,是让改写后的 harness 带来更好的执行结果。

整个过程中,solver 模型的权重保持不变。适应发生在 harness 层面,而不是模型参数层面。

测试时适应的一条新路径

这套机制指向的是测试时适应:面对新任务时,不重新训练 solver,而是让提案模型现场改写 harness 代码来适配。solver 保持原样,harness 承担了调整的角色。