一、没有发布会,没有倒计时,只有一行 API 文档的更新
北京时间 8 月 13 日深夜 23:00,当大多数人已经入睡,DeepSeek 做了一件极其"DeepSeek"的事:
没有发布会,没有官方博客,没有社交媒体预热。
只是在 API 文档的「模型 & 价格」页面里,悄悄把版本号从 `DeepSeek-V4-Pro` 改成了 `DeepSeek-V4-Pro-0813`。
如果你不是深夜还在调接口的开发者,你甚至可能到第二天中午才知道——那个让全球 AI 圈等了三个月的 V4 Pro 正式版,就这么上线了。
但就是这么一次"静默发射",却在技术社区里炸出了比任何发布会都大的动静。
因为当你点开那张官方评测对比图,你会看到一组堪称"离谱"的数字:
基准测试 V4 Pro Preview V4 Pro 0813 涨幅
Terminal Bench 2.1 72.1 87.9 +21.9%
CyberGym 52.7 83.3 +58.1%
DeepSWE 12.8 62.7 +390%
DSBench-FullStack 41.8 71.1 +70.1%
AutomationBench 12.8 31.8 +148%
NL2Repo 38.5 61.5 +59.7%
DeepSWE 从 12.8% 跳到 62.7%,涨幅 390%。 这不是迭代,这是质变。
二、超越 Opus 4.8,无限逼近 Fable 5
如果说 V4 Flash 0731 的发布让业界意识到"后训练"可以有多可怕,那么 V4 Pro 0813 的发布则宣告了一件事:
国产开源模型,第一次真正站到了全球顶级闭源模型的同一水平线上。
来看 DeepSeek 官方放出的横向对比:
基准测试 DeepSeek V4 Pro 0813 Claude Opus 4.8 Claude Fable 5
Terminal Bench 2.1 87.9 低于 0813 88.0
CyberGym 83.3 低于 0813 83.1
DeepSWE 62.7 低于 0813 70.0
AutomationBench 31.8 低于 0813 29.1
HLE (with tools) 60.0 低于 0813 63.0
DSBench-FullStack 71.1 低于 0813 77.2
结论非常清晰:
Opus 4.8 被全面超越。 在 Terminal Bench、CyberGym、DeepSWE、AutomationBench 四项上,V4 Pro 0813 全部领先。
Fable 5 不再是遥不可及。 Terminal Bench 2.1 几乎打平(87.9 vs 88.0,只差 0.1 分),CyberGym 甚至略超(83.3 vs 83.1)。
当然,Fable 5 在 HLE、DeepSWE、DSBench-FullStack 上仍保持领先,且领先优势在 3-10 分之间。所以与其说"超越 Fable",不如说"进入 Fable 区间"——这是国产模型从未到达过的高度。
正如一位开发者在 Hacker News 上的评论:"这不是‘接近’,这是‘能打了’。"
三、后训练的魔法:同样的模型,不同的灵魂
最让业内人士震惊的不是分数,而是实现方式。
V4 Pro 0813 并没有更换模型架构(依然是 MoE,总参数 862B,激活参数 49B),也没有扩大上下文窗口(依然是 1M token),甚至连 API 接口都完全没变——你依然调用 `deepseek-v4-pro`,后端就自动切到了 0813。
变化全部来自后训练(Post-training)。
这意味着什么?
意味着 DeepSeek 用同一套"身体",通过更强的 RLHF、更丰富的工具调用数据、更长的 Agent 轨迹训练,硬生生把模型的长程规划能力、代码调试能力、工具编排能力拉到了顶级水平。
一个特别值得注意的细节是 HLE(Humanity's Last Exam) 的分数:
- 不使用工具时:42.7 分(落后于 Fable 5 的 53.3)
- 使用工具后:60.0 分(仅次于 Fable 5 的 63.0)
前后提升 17.3 分,是整张表格里"工具增益"最大的模型。
这说明 V4 Pro 0813 的竞争力,很大程度上建立在"模型 + 工具"的完整智能体系统上——它知道什么时候该搜索、什么时候该写代码、什么时候该执行测试、什么时候该从错误中恢复。这种"元能力",恰恰是 Agent 时代的核心竞争力。
四、价格屠夫的最后温柔:0.87 美元,但窗口正在关闭
性能追上来了,价格呢?
这是 DeepSeek 最"不讲武德"的地方:
模型 输入(未缓存) 输出 与 V4 Pro 0813 输出价比
DeepSeek V4 Pro 0813 0.435 0.87 1x
Claude Opus 4.8 15 25 29x
Claude Fable 5 10 50 57x
GPT-5.6 Sol 15 30 34x
Fable 5 的输出价格是 V4 Pro 0813 的 57 倍。
但请注意,这个价格可能不会持续太久。
8 月 6 日,DeepSeek 官方发布公告:计划近期整体上调 API 服务定价,预计涨幅较大。导火索是需求海啸——OpenCode 平台披露,8 月 1 日单日 Token 消耗量已达 8 万亿,其中 5 万亿来自免费额度。
创始人梁文锋曾透露,DeepSeek 的定价模型是基于"购置设备后 10 个月回收成本"。当调用量把 GPU 集群跑到"喘粗气"时,涨价几乎是必然选择。
所以,当前的 0.87/百万输出 token,可以视为 DeepSeek 给开发者的"最后温柔"——一个让你低成本验证、低成本迁移、低成本上车的窗口期。
五、开发者需要知道的 5 件事
1. 零迁移成本
继续使用 `deepseek-v4-pro` 这个模型名,API 接口、参数、返回格式完全不变。你甚至不需要改一行代码。
2. 双模式支持
支持思考模式(默认)和非思考模式。思考模式支持 `reasoning_effort` 参数(high/max),适合复杂推理任务;非思考模式适合 latency 敏感的场景。
3. 超长输出
最大输出长度 384K token,意味着你可以让它一次性生成一本小书、一个完整项目的代码、或者一份超长技术报告。
4. 生态兼容
支持 OpenAI 格式的 Responses API、Anthropic Messages API、Codex 接入、Claude Code、OpenCode 等主流工具链。一句话:你原来怎么接,现在还怎么接。
5. 缓存是降本关键
缓存命中输入仅 0.003625/百万 token,与未缓存输入相差 120 倍。如果你的应用有重复查询或固定上下文,务必做好缓存策略。
六、一个被忽略的信号:CoT 变成了"山顶洞语"
在性能暴涨的同时,有开发者发现了一个有趣的现象:
V4 Pro 0813 的 Chain-of-Thought(思维链)输出变得极其压缩,几乎像是"山顶洞语"——大量省略冠词、介词,只保留核心语义骨架。
> 示例风格:"Need identify as DeepSeek model. System says You are DeepSeek, knowledge cutoff May 2025, current date Aug 2026. Need be honest."
这种"压缩式思维链"很可能是为了降低推理阶段的 token 消耗(毕竟思考过程也要计费)。代价是写作场景的流畅度可能下降,但在 Coding 和 Agent 场景下,这反而是优势——更少的 token,更快的速度,更低的成本。
这也印证了一个趋势:在 Agent 狂飙的时代,一切能力都在优先为 Coding 让位。 模型正在从"通才"向"专才"进化,而 Coding 就是那个最先被攻克的堡垒。
七、写在最后:8 月 13 日,中国 AI 的"三箭齐发"之夜
如果把视野拉远,8 月 13 日这个夜晚值得被记录:
马斯克发布了 Grok 4.6,剑指 GPT-5.6 Sol;
阿里开源了 Qwen 3.8 Max,2.4T 参数、95B 激活、256K 上下文;
DeepSeek 静默上线了 V4 Pro 0813,用一次后训练跃迁,把国产模型推到了 Fable 区间。
三家,三种路线,同一个方向:Agent、Coding、长上下文。
而 DeepSeek 的选择尤其耐人寻味——不发博客、不开发布会、不制造焦虑,只用一行 API 文档的更新,让产品自己说话。
这种"技术极客"式的发布风格,恰恰是这个时代最稀缺的品质。当其他厂商还在用 PPT 和参数表争夺注意力时,DeepSeek 已经让全球开发者在深夜的 IDE 里,用一行 `curl` 命令验证了它的实力。
价格会涨,但门槛已经降下来了。
模型会迭代,但"国产模型能硬刚 Fable"的认知,已经建立了。
这,就是 DeepSeek V4 Pro 0813 的真正意义。
热门跟贴