2026 年 7 月 31 日,DeepSeek 宣布,DeepSeek-V4-Flash 正式版 API 进入公开测试。
此次更新重点提升 Agent 与编程任务能力,并原生支持 Responses API 格式,可直接适配 Codex。
新版本模型名称为 DeepSeek-V4-Flash-0731。
DeepSeek 特别说明,该版本与此前的 V4-Flash-Preview 采用完全相同的模型架构和参数规模,能力提升主要来自后训练升级,并非扩大模型规模或更换底层架构。
此次更新仅应用于 DeepSeek-V4-Flash API。
DeepSeek-V4-Pro API,以及 DeepSeek App、网页端当前使用的模型均未调整。
DeepSeek 同时透露,DeepSeek-V4-Pro 正式版将尽快发布。
多项 Agent 测试成绩接近闭源模型
DeepSeek 公布的测试数据显示,V4-Flash-0731 在九项 Agent、代码开发和终端操作基准中,均明显超过 V4-Flash-Preview,部分成绩同时超过此前的 V4-Pro-Preview。
在测试模型操作终端并独立完成真实任务的 Terminal-Bench 2.1 中,V4-Flash-0731 得分为 82.7,高于 V4-Flash-Preview 的 61.8 和 V4-Pro-Preview 的 72.1,也超过 GLM-5.2 的 81.0,仅低于 Claude Opus 4.8 的 85.0。
Terminal-Bench 2.1 涵盖软件配置、系统管理、模型训练等沙盒终端任务。
在衡量代码仓库理解与修改能力的 NL2Repo 中,新版本由 39.4 提升至 54.2;CyberGym 得分由 38.7升至 76.7;DeepSWE 得分则由 7.3大幅升至 54.4。
其他测试中,V4-Flash-0731 在 Toolathlon-Verified、Agents’ Last Exam 和 AutomationBench 上分别获得 70.3、25.2 和 25.1,均显著超过预览版。
面向全栈开发与高难度编程智能体任务的两项 DeepSeek 内部测试中,新版本在 DSBench-FullStack 上由 37.0升至 68.7,在 DSBench-Hard 上由 25.8升至 59.6。前者接近 Claude Opus 4.8 的 71.6,后者与 Opus 4.8 的 71.7仍有一定差距。
DeepSeek表示,公开代码智能体测试使用其即将推出的 DeepSeek Harness 最简模式,参数设置为最大迭代次数 95、温度 1.0;DSBench-FullStack 和 DSBench-Hard 则属于 DeepSeek 内部基准。
原生兼容 Responses API,进一步进入编程智能体生态
除模型能力升级外,DeepSeek-V4-Flash 正式 API 已原生支持 Responses API。该接口格式常用于管理多轮响应、工具调用及智能体执行过程,使开发者更容易将 DeepSeek 接入复杂的代码生成和任务自动化系统。
DeepSeek还表示,新版本已完成对 Codex 的适配。
开发者可以通过配置 DeepSeek API,将 V4-Flash 用作编程智能体背后的模型,执行读取代码仓库、调用终端、修改文件和验证结果等连续任务。
DeepSeek-V4-Flash 最初于 2026 年 4 月发布,采用混合专家架构,总参数量为 2840 亿,每次推理激活约 130 亿参数,并支持最高 100 万 Token 上下文。其定位是以更低推理成本和更快响应速度,承担编程、长文本及 Agent 工作负载。
此次升级没有改变模型规模,却使其多项 Agent 测试成绩出现数十个百分点的提升,显示 DeepSeek 正通过后训练、智能体执行框架和工具调用适配,将 V4-Flash 从低成本推理模型进一步推向代码智能体场景。
云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。
热门跟贴