没有发布会、没有官方推文,8月12日深夜,DeepSeek在API文档里悄悄把V4-Pro的版本号更新成了“0813”。
社区瞬间炸了。
有人喊“梁圣回归”,有人连夜跑分,有人开始焦虑——听说要涨价,到底是冲还是等?
我们花了一整夜实测,把结论放在前面:Agent能力确实脱胎换骨,但有一个“致命伤”可能被大多数人忽略了。
一、参数没变,变的是脑子
先说规格。V4-Pro-0813依然是1.6万亿总参数、每次推理激活约490亿参数的MoE架构,1M上下文窗口,最大输出拉到384K Token。
参数没变,架构没变。真正改变的是后训练。
DeepSeek对V4-Pro做了一次针对性的“后训练重做”——尤其在Agent和工具调用相关的训练数据上做了大幅改造。结果就是:模型还是那个模型,但干活的脑子换了。
二、Agent能力从“不及格”冲到“领跑”
官方公布的数据,最炸裂的是软件工程智能体测试DeepSWE——从预览版的12.8分直接飙到62.7分,涨了近5倍。
12.8分意味着几乎无法自主完成编码任务,62.7分已经是主流Agent产品的竞争区间。
其他Agent基准也全线大涨:Terminal Bench 2.1打到87.9,Cybergym冲到83.3,NL2Repo涨到61.5。
横向对比看,Terminal Bench 2.1仅比Claude Fable 5的88.0分低了0.1分,部分项目甚至实现了反超。
总结来看:前端审美发生质变,Agent能力稳稳得很踏实。
三、价格“还没涨”,但涨价预告已经贴出来了
定价方面,V4-Pro-0813维持了预览版的价格——每百万Token输入3元、输出6元,是Flash版的三倍。
但注意一个细节——DeepSeek在同一天明确贴出公告:“计划近期整体上调API服务定价,预计涨幅较大。”
这意味着当前的价格窗口可能是短暂的。如果你想用Pro版做大规模调用,现在是锁定成本的好时机。
四、致命伤:独立评测和官方数据对不上
数据看着很美,但问题在于——这些成绩目前主要来自DeepSeek自己的测试,尚未经过独立评测机构完整复现。
Artificial Analysis的独立评分显示,V4-Pro-0813得分为53分,比V4-Flash-0731只高了1分。
要知道Pro是1.6万亿参数,Flash只有2840亿,体量差了4倍多。虽然参数和性能不是线性关系,但用户预期显然比1分高得多。
更关键的是,V4-Flash-0731至今仍是大部分人的最优选择。它足以应付95%的日常使用场景,性价比高到让Pro有点尴尬。
DeepSeek V4 Pro-0813是一次扎实的升级——Agent能力的跃升是真实存在的,双协议兼容和Responses API的支持让接入变得前所未有的简单。
但“官方数据”和“第三方评测”之间的落差,以及那则“即将大幅涨价”的公告,都让这次发布蒙上了一层微妙的阴影。
如果你需要处理长链路Agent任务、大规模代码库分析,Pro版值得考虑,而且最好趁价格还没调整之前动手。但如果你的需求是日常对话和普通编程,Flash版依然是那个“性价比之王”。
至于那1分的差距值不值3倍的价格——这得看你手里那杆秤,量的是“性能”还是“钱包”。
热门跟贴