DeepSeek又卡着7月最后一天提交了一个版本。
7月31日,DeepSeek-V4-Flash正式版API开启公测。开发者不需要更换接口,只要继续使用原来的base_url,并把模型名称设置为:
deepseek-v4-flash
就能调用最新的0731版本。
乍一看,这像是一次普通的模型热更新。但程序员看完更新日志后,大概会发现:这次DeepSeek升级的重点,不是“回答更像人”,而是“改代码更像同事”。
一个Flash模型,开始抢Pro的活了
官方公布的Code Agent测试中,V4-Flash在Terminal Bench 2.1拿到82.7,NL2Repo为54.2,DeepSWE为54.4,Toolathlon-Verified为70.3,DSBench-FullStack为68.7。
这些成绩不仅明显超过V4-Pro-Preview,在多项任务中也超过了GLM-5.2,部分指标已经逼近Opus 4.8。
这件事有点像,公司原本招了一个“回复快、价格低”的实习生,结果上班几个月后发现,他已经能自己:
读取代码仓库→ 定位相关文件→ 修改代码→ 执行测试→ 阅读报错→ 再改一遍
以前的Flash模型,更适合代码补全、解释报错和写几个函数;现在的V4-Flash,开始进入完整的软件开发流程。
更关键的是,这次模型架构和尺寸并没有变化。V4-Flash-0731与Preview版本保持相同结构,主要升级来自后训练。
翻译成人话就是:DeepSeek没有给它换一个更大的脑子,而是重新教它怎么上班。
真正的更新,是原生支持Responses API
相比跑分,V4-Flash这次最值得关注的功能,其实是原生支持Responses API,并针对Codex进行了适配。
过去把DeepSeek接入新版Codex,通常需要CC Switch、Moon Bridge或者其他本地路由。
原因也不复杂。
大部分模型提供的是:
<> http
POST /chat/completions
这是传统聊天接口,逻辑基本是一问一答。
而Codex需要的是:
<> http
POST /responses
它要管理工具调用、任务状态、多轮执行和上下文压缩。以前DeepSeek听不懂Codex发来的“协议”,只能在中间放一个路由工具进行翻译。
现在,V4-Flash直接原生支持Responses API。换句话说,中间那个翻译可以下班了。
DeepSeek官方确认,目前只有deepseek-v4-flash能够直接接入Codex,V4-Pro预计在2026年8月初补上支持。
一条命令,把DeepSeek装进Codex
官方提供了自动配置脚本。
macOS和Linux执行:
<> Bash
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
Windows在PowerShell中执行:
<> Bash
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
输入DeepSeek API Key后,脚本会自动备份原有配置,生成~/.codex/models.json,并修改~/.codex/config.toml。想切回原来的Codex订阅,再运行一次脚本选择恢复即可。
喜欢手动改配置的程序员,也可以直接编辑config.toml:
<> TOML
model = "deepseek-v4-flash"
model_provider="deepseek"preferred_auth_method="apikey"forced_login_method="api"model_reasoning_effort="high"model_catalog_json="~/.codex/models.json"
[model_providers.deepseek]
name="deepseek"
base_url = "https://api.deepseek.com/"
wire_api = "responses"
experimental_bearer_token = "你的 DeepSeek API Key"
这里最关键的是:
<> TOML
wire_api = "responses"
它代表Codex会通过Responses API与DeepSeek通信。配置完成后,进入项目目录执行:
<> Bash
cd /path/to/my-projectcodex
启动页出现model: deepseek-v4-flash,就说明切换成功。Codex CLI、桌面端和VS Code扩展共用同一份配置,不需要重复设置。
友情提醒:API Key直接写在配置文件里,千万别顺手把整个.codex目录提交到GitHub。不然第二天醒来,可能会收获一个开源项目和一张账单。
跑分很强,但真实项目才是最终Benchmark
官方本次测试使用了即将发布的DeepSeek Harness,并将推理强度设置为max,同时采用top_p=0.95和temperature=1.0。另外,DSBench-FullStack和DSBench-Hard属于内部测试集。
所以,榜单成绩可以参考,但还不能直接等同于生产环境。
真实项目里的Benchmark通常是这样的:
没有文档
依赖过期
测试跑不起来
需求改了三次
产品经理说“应该很简单”
这也是V4-Flash接下来真正需要证明的地方:它能不能在几十轮工具调用后仍然记住任务目标,能不能改完代码主动跑测试,能不能遇到报错后继续排查,而不是突然开始重构整个项目。
AI编程,正在进入模型分工时代
V4-Flash正式版的意义,并不是“DeepSeek又多赢了几个跑分”。
它更像是一个信号:模型厂商已经开始从争夺聊天窗口,转向争夺Agent入口。
以后程序员选择模型,关注的不会只是“谁更聪明”,还会看:
能不能接入Codex?
工具调用稳不稳?
长任务会不会中断?
修改代码敢不敢直接合并?
跑完一个任务要烧多少Token?
简单修改、批量任务和页面生成,可以交给速度更快的V4-Flash;复杂架构和高风险重构,再切换到更强的旗舰模型。
AI编程正在从“找一个最强模型”,变成“组建一支模型开发团队”。
而DeepSeek-V4-Flash这次做的,就是把自己从聊天框里拉出来,打开终端,切进项目目录,然后输入:
<> Bash
git status
好了,开始干活。
热门跟贴