7 月的最后一天,DeepSeek V4 Flash 正式版上线公测。
这个消息似乎非常不起眼,但一看跑分,还是很惊人。
官方原话:Agent 能力大幅增强,基准测试远超 V4-Pro-Preview。
小的那个,把大的那个打了。
更骚的在后面。
官方补了一句,V4-Flash-0731 的结构和尺寸跟 preview 版完全一致,仅重新进行了后训练。
参数一个没加,架构一行没改,就是重新教了一遍怎么干活。这样我就更期待接下来要发布的 V4 Pro 了,应该在别一个大招吧?
看看参数,图二
DeepSWE 这项是指从真实项目里挑一个毛病让模型自己修。从 preview 到 正式版 ,暴涨了七倍多。
再看 Terminal Bench 2.1,这是指把模型直接扔进电脑命令行里,让它自己敲命令、装环境、把活干完,全程没人指挥。(这是 Agent 的基本能力)
这项直接超越了 GLM 5.2,甚至接近 Opus 4.8,而 Flash 只是一个小号模型啊。
最有意思的是榜单最后那两项。
Agents\x26#39; Last Exam 25.2,AutomationBench 25.1。乍一看惨不忍睹,一个能在命令行拿 82 分的模型,到这儿只剩四分之一。
但仔细一看,发现它有也接近 Opus 4.8 了。
Flash 都直奔 Opus 4.8 而去,那么 Pro 是不是意味着向目前最牛逼的GPT 5.6 Sol 和 Claude Fable 5 靠齐了?
拭目以待吧。
正式版还原生支持了 Responses API 并专门适配 Codex,你可以把 Codex 的后端直接换成 DeepSeek 了。
不写代码的人这块也说一句。
这次只动了 V4-Flash 的 API,Pro 的 API 和 APP、网页端都没变,你现在打开网页版聊天用的还是老版本。
普通用户还得等 V4 Pro 正式版。
热门跟贴