一个参数不算最庞大的模型,凭什么在智能水平上追平主流闭源选手,还保持着惊人的成本优势?刚刚发布的DeepSeek-V4-Flash-0731,正在用一份来自第三方机构Artificial Analysis的评测报告,给出答案。
2026年7月31日,中国AI公司DeepSeek在社交平台宣布,正式以可商用许可开源模型“DeepSeek-V4-Flash-0731”。官方特别说明,该版本与此前的预览版保持完全相同的架构与模型规模,本次升级仅作用于DeepSeek-V4-Flash API,V4-Pro API以及App/Web端模型暂未调整。
DeepSeek-V4-Flash-0731是今年4月亮相的V4-Flash的迭代版本,采用混合专家(MoE)架构,总参数量达到2840亿,而活跃参数仅为130亿。这种“大容量、轻激活”的设计,使其在推理时能够有选择地调动部分参数,从而同时兼顾高性能与低计算开销。
业界最关心的性能表现,Artificial Analysis用一组对比给出了清晰坐标。在综合智能性评测中,该模型被评价为与Google的Gemini 3.6 Flash处于同一水平。在开源模型阵营里,它的整体能力排在Kimi K3和GLM-5.2之后,但在编码任务上反而超越了GLM-5.2。而在更考验模型自主执行能力的代理(Agent)性能测试中,DeepSeek-V4-Flash-0731不仅大幅领先Gemini 3.6 Flash,甚至比OpenAI的GPT-5.6 Luna还高出0.1个点数。
这一结果很值得玩味。通常来说,提升代理性能意味着模型需要更强的规划、工具调用和步骤连贯性,这些往往依赖更大的模型规模或更精密的训练。而DeepSeek的MoE路线似乎找到了一个巧妙的平衡:不是把所有参数都激活,而是在需要时让最合适的专家单元“上岗”。
同样引人注意的,是该模型在成本侧的颠覆性表现。Artificial Analysis绘制的成本效率图中,横轴代表单任务成本,纵轴代表智能水平,DeepSeek-V4-Flash-0731的位置明显比7月底刚刚大幅降价的GPT-5.6 Luna更靠左、更低。换句话说,它在保持同等甚至稍占优势的智能水平时,每次调用支出的费用还要更低。开源模型第一次在“性价比”这个维度上,对最强闭源竞品形成了直接压力。
另一张参数规模与智能性能的关系图,则进一步凸显了DeepSeek的架构效率。横轴是模型总参数量,纵轴是智能评分,DeepSeek-V4-Flash-0731的数据点清晰地位于趋势线的上方区域——用更少的参数总量,撬动了不成比例的认知能力。这似乎回击了“参数越大越智能”的简单推论,也验证了MoE架构在资源利用上的优势。
开放生态的加持,让这场效率革命的影响力进一步放大。DeepSeek-V4-Flash-0731已在Hugging Face和ModelScope两大平台免费上线,默认采用MIT许可证,意味着任何人都可以将其用于商业产品或二次开发,几乎不受限制。
公布当天,社区就自发贡献了大量量化版本,不同硬件配置的优化版迅速涌现,进一步降低了开发者的部署门槛。一个低成本、高性能且毫无许可束缚的模型,正在把前沿AI能力推向更广泛的现实场景。
热门跟贴