大模型推理越来越慢,问题出在哪儿?斯坦福等机构的一篇新论文给出了一个反直觉的答案:中间那部分思维链,可能根本没必要保留。
这篇题为 Prefix Sliding for efficient test-time scaling 的论文提出了一种叫 Prefix Sliding 的方法——推理时只保留任务前缀和最近 token 的滑动窗口,把中间冗长的推理过程直接丢掉。结果令人意外:无需重新训练,推理速度就能提升约 3 倍。
打开网易新闻 查看精彩图片
思维链的"冗余"问题
长推理(long reasoning)模型在复杂任务上表现好,但代价是生成大量中间 token,推理成本和时间都跟着涨。此前的主流思路是压缩模型或优化计算,而 Prefix Sliding 的思路更直接:既然中间步骤是"过程",那能不能不存?
论文的核心做法是维护一个滑动窗口,只保留任务前缀和最近生成的 token,中间的推理 token 随窗口滑动被丢弃。这样既保留了任务上下文,又避免了中间过程的存储和计算开销。
3倍提速,代价是什么?
实验结果显示,在多个推理任务上,Prefix Sliding 让推理速度提升约 3 倍,且无需重新训练模型。这意味着它可以直接套用在现有模型上,落地门槛低了不少。
当然,论文也提到,丢弃中间 token 对某些需要完整推理链的任务可能有影响。但整体来看,这个方向给长推理的效率优化提供了一个新思路——不是让模型想得更快,而是让它少留"草稿"。
热门跟贴