一个预算级AI模型,评分只比OpenAI的当家小模型低1分,但每次任务成本却少了六成——这个差距到底从哪儿来的?答案指向了一项在行业里大幅领先的缓存折扣率。

DeepSeek近日发布了V4 Flash“0731”版本,对这一经济型模型做了一次重大升级。根据独立评测机构Artificial Analysis的智能指数,新版V4 Flash得分来到50分,比2026年4月推出的上一代V4 Flash足足高出10分。

打开网易新闻 查看精彩图片

横向对比,这个成绩距OpenAI的预算模型GPT-5.6 Luna只差1分。但成本端的差异却要明显得多:即使OpenAI已经将Luna的价格砍掉80%,V4 Flash 0731的单次任务成本仍比它低大约60%。

成本优势的一大推手,是DeepSeek给出的98%缓存命中折扣。行业普遍将缓存折扣定在90%上下,当用户的请求能够命中已经计算过的缓存时,DeepSeek能提供几乎免费的推理,这直接拉低了大量实际使用场景中的平均开销。与此同时,新模型生成相同内容所消耗的令牌数也比前代减少了12%,进一步压缩了推理成本。

性能提升不只体现在一个总评分数上。在所有被测试的细分类别中,0731版本均优于前代,其中进步最明显的是智能体任务。在专门用来评测模型在复杂现实办公场景中表现的GDPval基准里,V4 Flash从上代的1189 Elo分跃升至1559分,增幅超过三成。幻觉率也出现了下降,意味着回答更踏实。

模型的基础架构保持不变:总参数量2840亿,推理时激活130亿参数,支持高达100万令牌的上下文窗口。模型权重已通过MIT许可证在Hugging Face上公开,任何人可以自由下载、商用或进行二次开发。

可以说,DeepSeek这次更新的核心策略并不是一味卷评测分数,而是在“够用”的性能与极致成本之间重新画了一条线。用多10分的表现、明显更少的幻觉,以及大幅降本的设计,给出了一份对开发者和企业都更务实的开源方案。