亚马逊一篇新论文指出,KV缓存策略不只是推理阶段的优化手段,它反过来决定了模型该怎么训练。如果模型在推理时会丢掉一部分上下文,那训练时也应该主动模拟这种遗忘。
训练与推理不匹配,是长上下文失效的根源
打开网易新闻 查看精彩图片
论文里的做法很直接:把微调过程和KV缓存策略对齐。在128k token的测试里,用全注意力微调的模型,一旦换成稀疏推理,输出就变得冗长且没有意义。而按缓存策略微调的模型,能正常作答,也知道什么时候该停。
任意缓存策略都能用,显存门槛不高
这套方法不挑缓存策略,支持任意一种。计算4B模型梯度,在40 GB A100上就能跑起来。
热门跟贴