7月31日,DeepSeek官宣DeepSeek-V4-Flash正式版API(接口)开启公测。DeepSeek表示,DeepSeek-V4-Flash正式版大幅升级其代理能力,正式版的基准测试得分已远超V4-pro预览版。
基准测试数据显示,在Agent智能体终极测试中,V4-Flash正式版的得分为25.2分,接近Opus-4.8 25.7分的得分,远高于V4-pro预览版15.8的得分。
消息一出,吸引了全球AI开发者的关注,V4-Flash正式版的价格、公测体验、Agent(智能体)能力成为不少科技爱好者的关注点。
过去一年,DeepSeek凭借极低的API价格和优秀的模型能力,在全球开发者市场迅速建立影响力。DeepSeek V4-Flash正式版在大模型市场,对AI开发者而言,是否仍有吸引力?
实测:Agent能力不错 交付结果达到可用水平
在关注到DeepSeek-V4-Flash正式版API开启公测后,AI深度开发者张泽第一时间接入了V4-Flash正式版API ,在此之前,他深度使用codex和hermes等国内外各类AI产品。
V4-Flash正式版上线之后,张泽将其接入Hermes使用。“最直观的感受就是任务处理速度很快,在给到相同任务和提示词的情况下,V4-Flash正式版+Hermes大概用了40秒完成,而GPT-5.6 Sol+Codex用了1分47秒。当然也要承认Codex的输出内容质量确实更高一些,不过V4-Flash正式版的交付也达到了可用水平,在及格线之上。”
8月1日,AI开发者孙涛也向《每日经济新闻》记者反馈其体验后的感受,“在国内模型里,它比GLM 5.2会好一些,但是比GPT 5.6其实还差一些”。
对于V4-Flash正式版的Agent能力提升,孙涛反馈“现在主力用的工具一个是Codex,一个是Pi Agent。我把DeepSeek V4-Flash接入 Pi Agent,目前的使用体验挺好的,V4-Flash不像GPT那样是多模态,所以它的主要用途可能是在偏推理、代码和长文档这一块。”
而在Agent能力体验上,张泽认为,V4-Flash正式版在接入Hermes的实际使用中选择和调用skill的准确度总体上还不错,可以根据工具返回结果调整后续步骤,从实际体验来说,这套组合已经能够比较顺畅满足个人需求。
51万Tokens消耗0.53元 V4-Flash正式版性价比很高
不过对AI开发者以及个人爱好者而言,价格依然是他们的敏感区间。
6月29日,每经记者收到DeepSeek在今年6月底发给API用户的邮件,DeepSeek在邮件中提到了V4正式版在功能和性能上会有更多优化和提升,更重要的是,API定价策略首次引入了峰谷定价机制。
根据最新的定价机制,DeepSeek-V4-Pro的价格相较于4月份的预览版出现大幅下降。其中百万tokens输入(缓存命中)的价格下降幅度最为明显,从4月份的1元,下降为正式版平时价格0.025元,高峰时段0.05元。
图片来源:每经记者 整理
整体来看,对于API用户而言,DeepSeek-V4正式版发布,token(词元)成本有了大幅降低。但对DeepSeek而言,这次的定价调整,也存在不降反升的情况。
譬如DeepSeek-V4-Flash正式版,百万tokens输入(缓存未命中)和百万tokens输出在高峰时段的成本反而比4月的预览版定价翻倍,分别是2元和4元。
根据最新披露的百万tokens价格来看,DeepSeek的价格体系和此前邮件透露的保持一致。不过目前峰谷定价机制具体的执行时间,还未正式通知。
那么,对比国外大模型,V4-Flash正式版在成本上有多大的优势?
张泽给了每经记者一组非常直观且鲜明的对比。
按照当下的官方API定价,GPT-5.6 Sol每百万tokens输入、缓存输入和输出价格分别是5美元、0.5美元和30美元;而V4-Flash正式版分别是1元、0.02元和2元人民币,成本差距差不多在数十倍到上百倍。“在我平时只是利用AI搜集汇总信息、总结一些文件和简单编程的情况下,V4-Flash正式版非常香,性价比很高,从账单上看,V4-Flash正式版接入Hermes执行了一次本地文件阅读和全网的信息检索汇总任务用量大概是51万tokens,消耗0.53元。”
DeepSeek Harness即将公布
过去一年,DeepSeek凭借极低的API价格和优秀的模型能力,在全球开发者市场迅速建立影响力。越来越多企业开始接入DeepSeek API,大量海外开发者迁移至其平台,其调用量快速增长。
7月28日,OpenRouter最新数据显示,中国AI大模型周调用量领跑全球。依次为小米MiMo-V2.5、DeepSeek V4-Flash、腾讯HY3、智谱GLM-5.2以及DeepSeek V4Pro。DeepSeek的2个模型都挤进了前五名的席位。
OpenRouter官方此前披露,中国模型全球市场份额于6月初整体超越美国模型。截至7月26日的近28天统计数据显示,中国模型所占份额约为63.5%,美国模型份额为35.5%,双方差距进一步拉大。
而当AI的趋势向Agent转向时,Harness的重要性日益提升。Harness是包裹在AI模型外的一整套工作条件,负责给模型准备上下文、工具、任务状态、反馈和边界,简单说就是让AI智能体从”能聊天"变成"能干活"的基础设施。
DeepSeek在上半年加大Harness布局。在此前释放的招聘信息中,多次提到了Harness领域的人才招聘。6月21日,崔添翼在社交媒体发文表示,作为新成立的部门,DeepSeek Harness组的目标远大、工作繁重,仍然非常缺人。
时隔一个月后,DeepSeek-V4-Flash首次披露了DeepSeek Harness的新进展:DeepSeek Harness即将公布。
中信证券认为,Harness核心价值:一是解决长程任务痛点,将模型能力转化为稳定、低成本的端到端交付;二是连接模型与泛办公场景,拓展万亿市场并沉淀稀缺数据反哺迭代。AI竞争正由模型转向任务交付,成熟Harness厂商将占先机。
(文中孙涛、张泽均为化名)