大模型推理成本高,很大一块花在思维链上。这篇论文给出一条不训练的新路:把可复用的推理从生成阶段搬进提示词。

记忆增强压缩是核心方法。它先把已经解过的示例蒸馏成可复用推理记忆,查询时按需检索,再注入提示词

打开网易新闻 查看精彩图片

这样做的直接效果,是让一部分计算从自回归解码转移到更并行的预填充阶段。生成阶段少算一点,成本就降一点。

为什么值得关注

传统降本思路往往要微调或重新训练,门槛不低。这个方法不需要训练,靠的是对已有推理结果的压缩和复用。

对需要频繁调用大模型做相似任务的场景,这种把“想过的答案”存下来再用的思路,可能比一味堆算力更实际。