大模型在长上下文任务中偶发“抽风”的成因,或许终于迎来一项技术解释。字节Seed团队于今年9月底在arXiv预印本平台提交一篇论文,将矛头指向分块KV缓存压缩带来的相位敏感性,认为这正是DeepSeek出现上述现象的根源。
研究覆盖了基础版与后训练版的DeepSeek-V4-Flash、DeepSeek-V4-Pro,以及经过后训练的DeepSeek-V4.1-Flash。这些模型的架构均采用分块KV缓存压缩,以固定步幅将连续标记窗口压缩成更少的缓存条目。
由此带来的收益十分直观:进行长上下文推理时,内存占用和注意力计算开销均显著回落,这也解释了为何当前不少模型愿意选用这类压缩机制。
但压缩并非无偿。论文指出,该方法在原位置体系之外新增了一个位置坐标,即标记的相位,也就是标记相对于压缩窗口边界所处的位置。换言之,同一信息在压缩缓存中的“站位”不同,其检索表现便可能产生明显差异。
市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。
本文源自:市场资讯
作者:闻野
热门跟贴