7月31日下午,DeepSeek干了一件事。

没有发布会,没有直播,没有铺天盖地的宣传。

就在API文档里发了一篇更新日志。

DeepSeek-V4-Flash正式版API上线公测。

但就是这么一个“低调”的操作,让整个AI圈炸了锅。

因为这一次,AI不再只是“会聊天”了。

它开始像工程师一样干活了。

打开网易新闻 查看精彩图片

1.

先看硬指标。

DeepSeek这次直接甩出了9项基准测试成绩单。不是遮遮掩掩挑几个好看的,是9项全公开。

Terminal Bench 2.1——82.7分。

Cybergym(网络安全攻防模拟)——76.7分。

Toolathlon verified(工具调用综合测试)——70.3分。

NL2Repo(代码仓库生成)——54.2分。

最夸张的是DeepSWE——从预览版的7.3分直接飙到54.4分。

暴涨6倍多。

啥概念?之前Flash在这个编程测试里基本是“不及格”,现在直接冲到中上水平。

内部测试也不含糊:DSBench-FullStack(全栈开发)68.7分,DSBench-Hard(高难度编码)59.6分。

这些数字单独看可能没感觉。但你得知道——V4-Flash的总参数是2840亿,但激活参数只有130亿。

130亿什么水平?GLM-5.2是7400多亿参数,K3是2.8万亿。

130亿对7400亿,差了将近60倍。

用不到别人1/60的激活参数,打出了接近甚至超越的效果。

这就是DeepSeek最可怕的地方——不是在堆参数,是在优化效率。

2.

更让人细思极恐的,是这句话:

“DeepSeek-V4-Flash-0731的模型结构、尺寸和预览版保持一致,仅重新进行了后训练。”

底座没换,骨架没变,就是重新“教”了一遍。

结果Agent能力直接起飞。

这说明啥?说明在Agent这条赛道上,训练方法和数据质量的权重,正在超过模型规模。

以前大家拼的是“谁家房子大”——参数越多越牛。

现在DeepSeek告诉你:房子不用最大,装修得好照样住得舒服。

同样的骨架,不同的“教育”,效果天差地别。

这对整个行业的启示太大了——后训练,才是真正的护城河。

3.

这次更新还有一个隐藏大招——DeepSeek Harness首次亮相。

Harness团队今年3月才组建,负责人崔添翼是个90后,浙大计算机出身,6枚ACM亚洲区域赛金牌,曾在顶级量化机构Jane Street干了九年。

今年3月加入DeepSeek,5月开始招兵买马。

不到5个月,Harness就出来了。

这速度,只能说明一件事:DeepSeek在Agent这条路上,早就开始布局了。

梁文锋之前说过一段话:“AI现在不缺品位和直觉,它缺的是持续学习的能力。投资人看Agent,我们看怎么解决学习。”

Harness就是解决“学习”的那个工程落点。

4.

再说个对开发者特别重要的消息。

正式版V4-Flash原生支持Responses API格式,并针对性适配了Codex。

Responses API是OpenAI力推的新一代API格式,比传统的Chat Completions更适合Agent场景——工具调用更灵活、多轮交互更复杂、输出控制更精细。

Codex适配则瞄准了代码生成与软件开发。

翻译成大白话:你用OpenAI那套工具链开发的Agent应用,现在可以低成本迁移到DeepSeek上。

开发者不用重新学一套东西,改个模型名就能用。

这招太狠了——直接掏了OpenAI开发者生态的墙脚。

5.

价格呢?

V4-Flash百万tokens输入(缓存命中)平时只要0.02元,高峰时段0.04元。

百万tokens输出平时2元,高峰时段4元。

什么概念?OpenAI那边GPT-5.6 Luna刚降价80%,输入价从1美元砍到0.2美元。

0.2美元,约合人民币1.4元。

DeepSeek这边是0.02元。

差了70倍。

有网友让GPT整理了V4 Flash和其他模型的性价比对比——Flash依然无敌,比降价后的GPT-5.6 Luna还要便宜一半以上。

一边是性能追平甚至超越,一边是价格便宜几十倍。

这还怎么打?

6.

而且你得把这事放在更大的背景里看。

截至7月26日,中国AI模型全球市场份额已经达到63.5%,美国模型只剩35.5%。

DeepSeek凭借V4 Flash和V4 Pro两款模型,合计占了Top 10总量的16.4%,是平台内覆盖最广的模型提供商。

全球每10个用大模型的开发者里,就有超过6个在用中国模型。

这放在三年前,谁敢想?

更狠的是——美国企业也在转向中国AI模型。2026年4月,美国企业通过OpenRouter的Token使用量中,中国模型占了46%。

DeepSeek以17.6%的市占率领先,超过了Google和OpenAI。

美国人自己都在用DeepSeek。

7.

最后说几句掏心窝的话。

2023年大模型拼的是“通用能力”——谁能聊天、谁能写诗。

2024年拼的是“长上下文”——谁能一次处理更多信息。

2026年的关键词,毫无疑问是Agent。

Agent是啥?是模型自主规划、调用工具、执行复杂任务的能力。

以前你让AI“帮我修个Bug”,它给你一段代码建议——你还得自己动手。

现在你让AI“帮我修个Bug”,它自己打开终端、分析代码仓库、调用工具、跑测试、修完提交。

从“建议者”变成了“执行者”。

这才是这次更新的真正意义。

AI不再只是“会说话”了。

它开始“会干活”了。

你觉得程序员会被AI取代吗? 你用过大模型写代码吗?体验咋样?

评论区聊聊。