一、没有发布会,没有倒计时,只有一行 API 文档的更新

北京时间 8 月 13 日深夜 23:00,当大多数人已经入睡,DeepSeek 做了一件极其"DeepSeek"的事:

没有发布会,没有官方博客,没有社交媒体预热。

只是在 API 文档的「模型 & 价格」页面里,悄悄把版本号从 `DeepSeek-V4-Pro` 改成了 `DeepSeek-V4-Pro-0813`。

如果你不是深夜还在调接口的开发者,你甚至可能到第二天中午才知道——那个让全球 AI 圈等了三个月的 V4 Pro 正式版,就这么上线了。

但就是这么一次"静默发射",却在技术社区里炸出了比任何发布会都大的动静。

因为当你点开那张官方评测对比图,你会看到一组堪称"离谱"的数字:

基准测试 V4 Pro Preview V4 Pro 0813 涨幅

Terminal Bench 2.1 72.1 87.9 +21.9%

CyberGym 52.7 83.3 +58.1%

DeepSWE 12.8 62.7 +390%

DSBench-FullStack 41.8 71.1 +70.1%

AutomationBench 12.8 31.8 +148%

NL2Repo 38.5 61.5 +59.7%

DeepSWE 从 12.8% 跳到 62.7%,涨幅 390%。 这不是迭代,这是质变。

二、超越 Opus 4.8,无限逼近 Fable 5

如果说 V4 Flash 0731 的发布让业界意识到"后训练"可以有多可怕,那么 V4 Pro 0813 的发布则宣告了一件事:

国产开源模型,第一次真正站到了全球顶级闭源模型的同一水平线上。

来看 DeepSeek 官方放出的横向对比:

基准测试 DeepSeek V4 Pro 0813 Claude Opus 4.8 Claude Fable 5

Terminal Bench 2.1 87.9 低于 0813 88.0

CyberGym 83.3 低于 0813 83.1

DeepSWE 62.7 低于 0813 70.0

AutomationBench 31.8 低于 0813 29.1

HLE (with tools) 60.0 低于 0813 63.0

DSBench-FullStack 71.1 低于 0813 77.2

结论非常清晰:

  • Opus 4.8 被全面超越。 在 Terminal Bench、CyberGym、DeepSWE、AutomationBench 四项上,V4 Pro 0813 全部领先。

  • Fable 5 不再是遥不可及。 Terminal Bench 2.1 几乎打平(87.9 vs 88.0,只差 0.1 分),CyberGym 甚至略超(83.3 vs 83.1)。

当然,Fable 5 在 HLE、DeepSWE、DSBench-FullStack 上仍保持领先,且领先优势在 3-10 分之间。所以与其说"超越 Fable",不如说"进入 Fable 区间"——这是国产模型从未到达过的高度。

正如一位开发者在 Hacker News 上的评论:"这不是‘接近’,这是‘能打了’。"

三、后训练的魔法:同样的模型,不同的灵魂

最让业内人士震惊的不是分数,而是实现方式。

V4 Pro 0813 并没有更换模型架构(依然是 MoE,总参数 862B,激活参数 49B),也没有扩大上下文窗口(依然是 1M token),甚至连 API 接口都完全没变——你依然调用 `deepseek-v4-pro`,后端就自动切到了 0813。

变化全部来自后训练(Post-training)。

这意味着什么?

意味着 DeepSeek 用同一套"身体",通过更强的 RLHF、更丰富的工具调用数据、更长的 Agent 轨迹训练,硬生生把模型的长程规划能力、代码调试能力、工具编排能力拉到了顶级水平。

一个特别值得注意的细节是 HLE(Humanity's Last Exam) 的分数:

- 不使用工具时:42.7 分(落后于 Fable 5 的 53.3)

- 使用工具后:60.0 分(仅次于 Fable 5 的 63.0)

前后提升 17.3 分,是整张表格里"工具增益"最大的模型。

这说明 V4 Pro 0813 的竞争力,很大程度上建立在"模型 + 工具"的完整智能体系统上——它知道什么时候该搜索、什么时候该写代码、什么时候该执行测试、什么时候该从错误中恢复。这种"元能力",恰恰是 Agent 时代的核心竞争力。

四、价格屠夫的最后温柔:0.87 美元,但窗口正在关闭

性能追上来了,价格呢?

这是 DeepSeek 最"不讲武德"的地方:

模型 输入(未缓存) 输出 与 V4 Pro 0813 输出价比

DeepSeek V4 Pro 0813 0.435 0.87 1x

Claude Opus 4.8 15 25 29x

Claude Fable 5 10 50 57x

GPT-5.6 Sol 15 30 34x

Fable 5 的输出价格是 V4 Pro 0813 的 57 倍。

但请注意,这个价格可能不会持续太久。

8 月 6 日,DeepSeek 官方发布公告:计划近期整体上调 API 服务定价,预计涨幅较大。导火索是需求海啸——OpenCode 平台披露,8 月 1 日单日 Token 消耗量已达 8 万亿,其中 5 万亿来自免费额度。

创始人梁文锋曾透露,DeepSeek 的定价模型是基于"购置设备后 10 个月回收成本"。当调用量把 GPU 集群跑到"喘粗气"时,涨价几乎是必然选择。

所以,当前的 0.87/百万输出 token,可以视为 DeepSeek 给开发者的"最后温柔"——一个让你低成本验证、低成本迁移、低成本上车的窗口期。

五、开发者需要知道的 5 件事

1. 零迁移成本

继续使用 `deepseek-v4-pro` 这个模型名,API 接口、参数、返回格式完全不变。你甚至不需要改一行代码。

2. 双模式支持

支持思考模式(默认)和非思考模式。思考模式支持 `reasoning_effort` 参数(high/max),适合复杂推理任务;非思考模式适合 latency 敏感的场景。

3. 超长输出

最大输出长度 384K token,意味着你可以让它一次性生成一本小书、一个完整项目的代码、或者一份超长技术报告。

4. 生态兼容

支持 OpenAI 格式的 Responses API、Anthropic Messages API、Codex 接入、Claude Code、OpenCode 等主流工具链。一句话:你原来怎么接,现在还怎么接。

5. 缓存是降本关键

缓存命中输入仅 0.003625/百万 token,与未缓存输入相差 120 倍。如果你的应用有重复查询或固定上下文,务必做好缓存策略。

六、一个被忽略的信号:CoT 变成了"山顶洞语"

在性能暴涨的同时,有开发者发现了一个有趣的现象:

V4 Pro 0813 的 Chain-of-Thought(思维链)输出变得极其压缩,几乎像是"山顶洞语"——大量省略冠词、介词,只保留核心语义骨架。

> 示例风格:"Need identify as DeepSeek model. System says You are DeepSeek, knowledge cutoff May 2025, current date Aug 2026. Need be honest."

这种"压缩式思维链"很可能是为了降低推理阶段的 token 消耗(毕竟思考过程也要计费)。代价是写作场景的流畅度可能下降,但在 Coding 和 Agent 场景下,这反而是优势——更少的 token,更快的速度,更低的成本。

这也印证了一个趋势:在 Agent 狂飙的时代,一切能力都在优先为 Coding 让位。 模型正在从"通才"向"专才"进化,而 Coding 就是那个最先被攻克的堡垒。

七、写在最后:8 月 13 日,中国 AI 的"三箭齐发"之夜

如果把视野拉远,8 月 13 日这个夜晚值得被记录:

  • 马斯克发布了 Grok 4.6,剑指 GPT-5.6 Sol;

  • 阿里开源了 Qwen 3.8 Max,2.4T 参数、95B 激活、256K 上下文;

  • DeepSeek 静默上线了 V4 Pro 0813,用一次后训练跃迁,把国产模型推到了 Fable 区间。

三家,三种路线,同一个方向:Agent、Coding、长上下文。

而 DeepSeek 的选择尤其耐人寻味——不发博客、不开发布会、不制造焦虑,只用一行 API 文档的更新,让产品自己说话。

这种"技术极客"式的发布风格,恰恰是这个时代最稀缺的品质。当其他厂商还在用 PPT 和参数表争夺注意力时,DeepSeek 已经让全球开发者在深夜的 IDE 里,用一行 `curl` 命令验证了它的实力。

价格会涨,但门槛已经降下来了。

模型会迭代,但"国产模型能硬刚 Fable"的认知,已经建立了。

这,就是 DeepSeek V4 Pro 0813 的真正意义。