过去两年里,几乎所有前沿AI实验室都在做同一个承诺:更大的上下文窗口。从200K到1M,再到2M Token,宣传片一版比一版震撼,但真正的账单却让开发者们笑不出来。当你把一个真实的百万Token提示词塞进标准Transformer模型,KV缓存就可能吃掉几十GB显存,而每一Token的推理成本更是高到足以击穿任何产品利润。 2026年4月24日,DeepSeek静悄悄给出了答案。据MIT Technology Review报道,这家中国实验室以MIT许可证发布了DeepSeek-V4-Pro(总参数1.6T,激活参数49B)和DeepSeek-V4-Flash(总参数284B,激活参数13B),两者均原生支持1048576 Token上下文。官方发布说明中的两个数字尤为醒目:在1M Token长度下,V4-Pro每Token推理FLOPs只有前代V3.2的27%,KV缓存占用降至10%;V4-Flash更是把这两个指标分别压到10%和7%。 这篇解读会讲清楚V4到底是什么、混合注意力机制为什么关键、它在与闭源模型的对比中表现如何,以及如果你正在做依赖长上下文推理的产品,接下来该怎么做。 DeepSeek V4是一个混合专家(MoE)语言模型家族,以开源权重形式托管在Hugging Face上。两个变体共享同一套核心架构创新——混合注意力堆栈。所谓混合,就是把两种不同的上下文压缩策略按层交错排列,而不是每一层都做密集自注意力。这样做的直接结果是:既保住了长距离依赖建模能力,又大幅砍掉了KV缓存和计算量。两个变体都原生支持100万Token上下文,而且都使用MIT许可证——你可以直接微调、蒸馏、封装进商业产品,不需要任何授权谈判。 这些权重是真实可下载的,不是一纸论文。今天你就能在vLLM或SGLang里跑起来,部署在自己的端点上对外提供服务。 那标准Transformer为什么这么贵?问题出在两头:第一,KV缓存随着序列长度线性增长,存储的是每个历史Token对应的中间张量;第二,计算复杂度是平方级,因为每个新Token都要和上下文里所有过去Token做注意力计算。于是越长的上下文,越贵的推理。2025年的多数“长上下文”模型都靠线性注意力近似、环形注意力分区或者激进量化来绕开问题,真正在架构层面正面解决的极少。DeepSeek V4是第一个以开源形式把这个问题解决到可商用程度的模型。 从机制上看,V4的混合注意力把Transformer层分成两组:一部分层保留全局注意力,用于捕捉全局信息;另一部分层使用压缩型注意力,把历史Token压缩成固定长度的记忆块,从而避免每个Token都去关注每个Token。这种交替设计既缓解了上下文长度带来的二次方膨胀,又不会像纯线性注意力那样失去精确检索能力。 在第三方评测中,V4-Pro在多个长文档理解、多跳推理和代码仓库分析任务上与GPT-4.1、Claude 3.5 Sonnet等闭源旗舰模型打得有来有回,尤其在需要事实精确性的“大海捞针”测试中表现相当,而每Token成本却低得多。这意味着同样预算下,你可以处理更长的输入,或者承受更大的并发量。 对产品开发者而言,最直接的变化是:以前不敢用的真·百万Token上下文,现在终于可以纳入预算了。长文档问答、代码库级理解、Agent长期记忆,这些场景过去都受限于KV缓存和显存墙,如今有了更现实的技术选择。如果要兼顾吞吐和延迟,可以先上V4-Flash;遇到复杂推理任务,再切到V4-Pro。另外,MIT许可意味着哪怕模型后来被集成进闭源产品,也不涉及许可证纠纷,这给商用落地扫平了最大障碍。 当然,任何模型都不是银弹。混合注意力在处理模糊查询、跨极长文本的非线性推理时,真实表现还需要更多生产环境的检验。但至少从成本和架构角度,V4让“百万Token上下文”第一次从营销口号变成了可结算的工程现实。 如果你打算尝试,建议从最新版vLLM开始,它对V4的混合注意力做了专门优化。部署时要注意GPU资源规划:V4-Pro虽然KV缓存变小了,但1.6T总参数的MoE结构依然需要多卡并行;Flash版本则更轻盈,适合快速试点。总之,DeepSeek V4是一次分水岭,证明了大上下文不一定等于高价格。接下来,或许我们会看到更多实验室跟进这条混合注意力的路径。在那之前,下载权重,动手测一测,比看任何报告都管用。

打开网易新闻 查看精彩图片