斯坦福新方法让长推理提速3倍,内存占用封顶且性能持平
薛定谔的BUG
·北京
斯坦福大学一项新研究提出名为Prefix Sliding的方法,在生成阶段丢弃推理轨迹中间的token,只保留包含指令与工具的前缀以及末尾数千个token。这样处理之后,内存占用被限制在一个固定上限内。
无需额外训练即可提速
打开网易新闻 查看精彩图片
该方法不需要对现有模型进行训练,就能让模型速度提升3倍,同时性能与全注意力机制持平。研究还支持超过100,000 token的强化学习rollout,为长上下文推理提供了新的实现路径。
相关论文已发布在arxiv.org,编号为2608.26070。
热门跟贴