复杂任务为什么越训越崩?一篇新论文给出了一个思路:让模型递归地改写自己的任务轨迹。

这篇论文的标题是《Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite》,发布在 Hugging Face 的论文页面上。从标题看,它要解决的是复杂任务中轨迹扩展的问题,方法核心是"递归自改写"。

打开网易新闻 查看精彩图片

递归自改写是什么思路

按照标题字面理解,模型不是一次性生成完整轨迹,而是对自己的输出进行递归式的重写。每一轮改写都在上一轮的基础上推进,让轨迹逐步扩展、变复杂。

这种做法针对的是复杂任务里轨迹难以规模化的问题。任务越复杂,单次生成的轨迹越容易断裂或走偏,递归改写相当于把一次大跳跃拆成多次小步迭代。

论文页面显示在 Hugging Face 上,说明研究已公开可查。目前公开信息只有标题和链接,具体方法细节、实验数据尚未在素材中展开。

为什么值得关注

复杂任务的轨迹扩展一直是训练里的难点。如果递归自改写这条路走得通,意味着模型可以在不依赖外部标注的情况下,自己把简单轨迹滚成复杂轨迹。

这条推文发布于 10月5日凌晨4:12,目前有 1,830 次浏览。关注度还不高,但方向本身值得盯一下。