IT时代网10月9日消息,字节Seed团队9月底在预印本平台提交的一篇论文,找到了DeepSeek模型长上下文场景下偶发异常的一个解释:分块KV缓存压缩引入的相位敏感性。研究评估了DeepSeek-V4-Flash、DeepSeek-V4-Pro的基础版与后训练版,以及后训练后的DeepSeek-V4.1-Flash。

分块KV缓存压缩以固定步幅把连续标记的窗口压缩为更少的缓存条目,能够降低长上下文推理的内存与注意力开销。但这种压缩同时引入了一个新的位置坐标,即标记相对于压缩窗口边界的相位。团队发现,使用这种压缩的模型存在系统性不对称:相同的信息在一个相位上很容易检索,换到另一个相位则变得困难。

团队把这种检索性能的周期性变化称为相位敏感性。在采用此类压缩的大型开放权重模型中,长上下文检索准确度在不同相位之间最多相差40个百分点,平均基准分数掩盖了这种周期性弱点。这也意味着,跑分接近的模型在实际长上下文任务中的表现可能忽好忽坏。

该论文目前为预印本版本,结论以同行评议与后续研究为准。

打开网易新闻 查看精彩图片

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟