打开网易新闻 查看精彩图片

整理 | 褚杏娟

刚刚,DeepSeek-V4-Pro 迎来 0813 版本更新。DeepSeek 官方 API 文档已将deepseek-v4-pro对应的模型版本更新为DeepSeek-V4-Pro-0813,原有调用方式和模型名称保持不变。

公开信息显示,DeepSeek-V4-Pro-0813 仍是一款混合专家模型,主要面向复杂推理、代码开发和长流程智能体任务。目前官方尚未披露 0813 版本的参数规模变化、训练方法以及与此前预览版的具体差异。

打开网易新闻 查看精彩图片

在模型规格方面,V4-Pro-0813 支持 100 万 Token 上下文,单次最大输出达到 38.4 万 Token,同时提供思考和非思考两种模式,其中思考模式为默认设置。

新版本继续支持 JSON 结构化输出、工具调用、Responses API 和 Anthropic API,并保留 Chat Prefix Completion 及 FIM 补全功能。开发者无需修改现有模型名称,只需继续调用deepseek-v4-pro,即可使用最新版本。

价格方面,DeepSeek 目前暂时没有随 0813 版本上线调整 API 费用:

  • 缓存命中输入:0.003625 美元 / 每百万 Token

  • 缓存未命中输入:0.435 美元 / 每百万 Token

  • 输出:0.87 美元 / 每百万 Token

  • 并发上限:500

不过,DeepSeek 此前已在官方价格页面提示,计划在近期整体上调 API 服务价格,并称预计涨幅较大,当前价格可能是新版本上线初期的过渡定价。

“与 Opus 4.8 性能相当,但弱于 Sol 或 Fable。价格便宜约 20 倍。”这是网友给的评价。目前社群流传的内部测评结果如下:

打开网易新闻 查看精彩图片

整体看,新版本模型在终端操作能力接近 Kimi-K3、Fable 5 等模型,但在通用推理、复杂软件工程和综合工具调用等项目上尚未全面领先。

相较 V4-Pro Preview,V4-Pro-0813 在九项智能体测试中平均提高约 25.7 分。这一变化表明,0813 版本的升级重点是提升模型在真实代码库中规划任务、调用工具、修改代码、运行测试和处理失败的能力。此前表现相对薄弱的长流程代码任务,已经成为正式版的主要能力方向。

HLE 测试进一步显示出 V4-Pro-0813 对外部工具的依赖程度。在不使用工具时,该模型得分为 42.7,落后于 Kimi-K3、Opus 4.8 和 Fable 5;使用工具后成绩升至 60.0,仅次于 Fable 5 的 63.0,前后提高 17.3 分,是表中工具增益最大的一款模型。这一结果表明,V4-Pro-0813 的竞争力很大程度上体现在“模型 + 工具”的完整系统中,能通过搜索、代码执行、工具调用和结果整合组成的智能体工作流。

值得注意是,按照 DeepSeek 当前 API 价格,Pro 缓存未命中输入为每百万 Token 0.435 美元,输出为 0.87 美元,约为 Flash 的 3.1 倍;Pro 并发上限为 500,Flash 则为 2500。

对于高并发和成本敏感的智能体应用,V4-Flash 可能仍是更合适的选择。实际部署时,也可以先使用 Flash 处理普通任务,再将失败或高难度任务交给 Pro 处理。这基本与开发者的使用体感是相似的:

我发现,在“每个任务”的表现上,Pro 相比最近发布的 Flash 要好很多,尤其是在代码审查之类的场景中。Flash 会犯更多初始错误,然后不得不重新检查;相比 Pro,它产生的输出量也大得多。它通常最终也能得到正确结果,但输出量经常是 Pro 的 5 倍以上。而且它最开始给出的结论往往是错误的,比如会说“这里有一个 bug”,或者“这段代码无法编译”,但实际上代码没有问题。然后它经常会出现类似这样的自我修正过程:“等等,让我重新检查一下。”或者:“实际上,更仔细地看了一下……”接着它会进一步思考一会儿,最终得到正确答案。

不过,也有开发者算账,DeepSeek V4 Pro 每次请求成本约 0.000875 美元,而如果使用等效能力的 Claude Opus 模型(不考虑缓存写入成本),每次请求成本约为 0.052 美元。也就是说,在 Agent 编程这种高度依赖上下文缓存的场景下,两者实际成本差距可以达到约 60 倍。

打开网易新闻 查看精彩图片

与马斯克同时打擂?

有趣的是,几乎同时,马斯克旗下 SpaceXAI 迅速推出了 Grok 4.6,重点针对编程、智能体任务和知识工作进行优化,并支持调节推理强度。

打开网易新闻 查看精彩图片

Grok 4.6 上下文窗口为 50 万 Token,与 Grok 4.5 保持一致。价格上,每百万输入和输出 Token 分别为 2 美元和 6 美元;缓存命中输入价格为每百万 Token 0.5 美元,高于 Grok 4.5 的 0.3 美元。

Artificial Analysis 表示,该价格比 Claude Opus 5 的 5 美元 /25 美元及 GPT-5.6 Sol 的 5 美元 /30 美元低 60% 以上。Grok 4.6 的平均单项任务成本为 0.84 美元,与 Kimi K3 相同,但智能指数略高,因此进入“智能水平—单项任务成本”的帕累托前沿,即在相近成本下没有其他模型能够提供明显更高的智能水平。

打开网易新闻 查看精彩图片

Artificial Analysis 近日公布 Grok 4.6 测评结果。数据显示,该模型在 Artificial Analysis 智能指数中获得 61 分,与最高推理档位的 GPT-5.6 Sol 持平,仅落后于 Claude Opus 5 和 Claude Fable 5。

打开网易新闻 查看精彩图片

对此,有网友质疑,“这些数据的误差范围是多少呢?因为最上面 Opus 5 的那个数据实在是太离谱了……”还有网友表示,“更智能,但价格则是原来的 3 倍?对智力的提升感到很高兴,不过对价格有些失望。”

声明:本文为InfoQ 整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

2026 年 AICon 人工智能开发与应用大会 · 深圳站将于8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。