小模型想变聪明,通常的做法是让它"想久一点"——写更长的思维链,生成更多token。但卡内基梅隆大学和牛津大学的一篇新论文指出,模型可以不写更长的推理过程,而是反复改进隐状态,让它在内部多迭代几轮。
论文显示,循环流(looped flows)表明,这些额外的步骤能实打实地提升准确率。也就是说,测试时的算力投入,不一定非要换成更多的输出token。
打开网易新闻 查看精彩图片
隐状态迭代,而不是token堆叠
思路的核心在于:模型可以"想得更久",但思考发生在内部表示上,而不是外显的文字链条上。小模型通过多轮精炼自己的隐状态,推理表现可以更好。
这挑战了一个默认前提——测试时算力增加,等于生成更多token。论文给出的替代方案是,把算力花在反复打磨同一份内部表示上。
问题也随之而来:循环模型在长循环上很难训练。模型可能一直在更新隐状态,但这些更新会变得不稳定,或者干脆不再带来任何帮助。
循环流怎么解决训练难题
循环流的做法是,把每一次更新都当作一个小型去噪任务来训练,同时确保更新后的隐状态对下一次更新仍然有用。
这样一来,模型在推理阶段就能持续改进同一份内部表示,而不是每多一步就偏离方向。训练时的稳定性问题,被拆解成了一个个可控的小任务。
对关注推理成本的人来说,这个方向值得留意:如果隐状态迭代真的能替代长思维链,那么"让模型多想一会儿"这件事,未必需要付出成倍的token开销。
热门跟贴