出品 | 网易智能

作者 | 小小

编辑 | 王凤枝

DeepSeek又一次引发海外开发者热议,连马斯克都在X上关注了它。

打开网易新闻 查看精彩图片

7月31日,DeepSeek正式开放V4 Flash API公测。官方公布的测试结果显示,新版本在多个智能体基准测试中大幅超过此前的V4-Pro Preview。

打开网易新闻 查看精彩图片

真正让开发者兴奋的,并不只是一次科技圈围观,而是DeepSeek V4 Flash走出的路线:

在保持2840亿总参数规模、单Token激活130亿参数和100万Token上下文窗口的基础上,通过后训练优化提升智能体与代码能力。

更关键的是,它把这种能力压到了一个极低的价格区间。

V4 Flash每百万未命中缓存输入Token仅1块钱,输出Token 2块钱;缓存命中输入成本更低至2分钱。 海外开发者实测中,单次任务调用成本甚至低至0.0005美元,与部分竞品拉开了数量级差距。

这也是DeepSeek V4 Flash真正引发关注的原因:

它不只是又一个"便宜能用"的模型,而是在尝试证明,接近前沿水平的智能体能力,也可以用远低于传统旗舰模型的成本运行。

官方同时明确表示,本次更新仅升级DeepSeek-V4-Flash API,V4 Pro API与客户端维持不变,V4 Pro正式版即将发布。

打开网易新闻 查看精彩图片

当OpenAI、Anthropic等头部实验室仍在围绕更强模型和更高算力投入竞争时,DeepSeek正在重新提出另一个问题:

前沿智能,究竟应该卖多少钱?

01马斯克关注之后,海外社区为何热议

"马斯克需要亲自试试V4 Flash。它就像魔法一样。"

这句话最初来自X上的开发者讨论。

随着这句话传播,网友发现,埃隆·马斯克真的关注了DeepSeek官方账号。这一细节迅速在海外社区引发讨论。

有网友认为,马斯克与DeepSeek在推动AI技术发展、探索科学突破方面存在一些共同点;也有人开始猜测未来可能出现合作。

当然,更多开发者选择用玩笑回应。有人调侃下一代编程模型Composer 3.5可能会基于DeepSeek构建;还有网友直接调侃Grok:

"我猜他要买下DeepSeek。你说呢Grok,你的爹要给你买个小弟弟吗?"

这些玩笑背后,是海外开发者对V4 Flash的真实兴趣:他们关注的不是一次社交媒体热搜,而是这个模型是否正在改变AI开发的成本结构。

02基准压测:官方数据与第三方验证怎么说

评估一次后训练的成效,最直接的办法就是看标准化测试集上的量化表现。

官方公布的基准测试中,V4 Flash在模拟真实命令行环境操作的Terminal Bench 2.1(82.7分)、网络安全攻防Cybergym(76.7分)以及复杂API协同Toolathlon Verified(70.3分)等智能体场景中均表现上佳。

而在代码工程化与复杂软件重构领域(如NL2Repo与DeepSWE),它同样取得了较好成绩,甚至在其内部的全栈难题测试集(DSBench-Hard)中拿下59.6分。

打开网易新闻 查看精彩图片

官方解释称,这套代码智能体表现是在最大努力级别与特定采样参数下跑出的。这种"小体积、高智商"的突破,直接打破了传统大模型"参数越庞大、智能体表现才越强"的固有认知。

第三方权威测评机构的交叉验证,进一步补充了该模型的表现细节。

测评机构Artificial Analysis在Intelligence Index智能指数测试中给予V4 Flash 50分的成绩,这一分数比上代模型提升10分,领先V4 Pro预览版6分,甚至追平了Gemini 3.6 Flash,并与GPT-5.6 Luna、GLM-5.2等模型接近。

打开网易新闻 查看精彩图片

在运行效率与输出质量方面,Artificial Analysis的测试表明,V4 Flash跑完整个智能指数消耗了2.06亿个输出Token,相比前代的2.34亿个下降12%。

同时,该模型在AA-Omniscience事实准确率与抗幻觉评估中的表现提升了12个百分点,展现出更好的上下文理解能力。

打开网易新闻 查看精彩图片

在评估真实世界智能体任务的GDPval-AA v2中,V4 Flash拿下1559的Elo评级,在开源权重模型中仅次于Kimi K3,超越了GLM-5.2。

而在Arena.ai前端代码竞技场中,DeepSeek-V4-Flash-High拿下1586分,位列竞技场第七名、开源模型第三名,较前代提升154分。

结合其首token延迟(TTFT)与吞吐量(TPS)表现,凭借98% 的缓存折扣,V4 Flash单任务执行成本比打折后的GPT-5.6 Luna还低60%。

Arena.ai评价指出,V4 Flash在前端代码与智能体领域重新塑造了"价格—质量"层面的帕累托前沿。

打开网易新闻 查看精彩图片

03开发者工程实测:150倍价差下的极致性价比

随着公测展开,开发者社区涌现出大量实操压测,V4 Flash在真实Terminal智能体、Canvas前端渲染以及跨模型工作流中的表现被多角度呈现。

在最直观的极限性价比层面,科技分析师 @RoundtableSpace在对比发布时间仅相隔七天的Opus 5时观察到,尽管Opus 5能一次完成复杂任务,而DeepSeek需要经过三次迭代尝试,但Opus输出了长达3000行代码,DeepSeek用约900行精简代码就达到了目的,且单次尝试成本仅约1美分。

打开网易新闻 查看精彩图片

科技博主 @SciTechera也援引数据进一步验证,在Terminal-Bench 2.1上,V4 Flash完成单个基准任务的估计花费仅为0.03美元, 相比高价旗舰模型展现出了极强的成本压制。

而当脱离极端高价模型、转而对比同预算档位的竞品时,V4 Flash依然保持了品质上的小幅领先。

在前瞻性的前端与动态交互测试中,开发者 @stevibe将降价后的OpenAI GPT-5.6 Luna与V4 Flash放在一起对比。

在3D魔方旋转测试中,DeepSeek的贴纸与旋转表现流畅,而Luna出现了贴纸位置错位的问题;在烟花爆破绽放效果中,Luna出现较明显的卡顿;而在笔写"Hello"草书的动态渲染上,Luna直接渲染为静态图像,DeepSeek则完成了动态草书轨迹。

@stevibe认为,在相同的预算档位下,DeepSeek的综合渲染表现略胜一筹。

打开网易新闻 查看精彩图片

除了直接对抗,面对V4 Flash暂未原生接入视觉输入的短板,开发者们探索出了具有实操价值的"跨模型组合"工作流

前端开发者 @hqmank在重建3D地球仪表板测试中,先让Kimi K3读取参考图像并提取布局与颜色规范,再将结构化文本转交给V4 Flash进行代码生成。实测结果显示,布局与间距被较好还原,而整体输出成本远低于完全调用顶级多模态模型。

打开网易新闻 查看精彩图片

这种灵活的生态配合,最终落脚于工业级智能体开发的成本账单上。

Bold Metrics CTO摩根·林顿(Morgan Linton)在VulcanBench测试后指出,V4 Flash在中等努力水平(Medium Effort)下的表现极其稳定,成功击败了Grok 4.5、Fable 和ChatGPT。

对于需要成千上万次API 调用的工业级智能体工作流而言,这种极低的价格让大批量自动化试错第一次具备了财务可行性。

打开网易新闻 查看精彩图片

大模型测评团队 @CommandCodeAI 在相同的游戏设计提示词测试中发现,Kimi K3与GLM 5.2表现出色,单次调用花费分别为0.0740美元和0.0480美元;而DeepSeek V4 Flash 虽在边缘细节上略显粗糙,但单次调用的实际账单仅为0.0005美元,便宜了整整150倍。

打开网易新闻 查看精彩图片

硬件与模型设计师 @bookwormengr 体验后感叹,V4 Flash 在如此小巧的体积和极低成本下展现出的知识密度简直如同"巫术", 虽然UI 和视觉交互体验上仍可向月之暗面借鉴,但其底层智力产出已足够令人震撼。

打开网易新闻 查看精彩图片

尽管V4 Flash 在性价比与常态代码补全上表现优异,但客观的工程压测中,它也暴露出了一定的技术边界:

首先,在极高难度的推理与算法突破场景中,Flash 模型的表现依然受限于其激活参数规模。 软件开发者 @OmedVibeCodes 在深度基准压测后指出,面对顶级模型(如GPT-5.6 Sol、Kimi K3等)时,V4 Flash 在处理极其复杂的长逻辑链求解上仍有明显差距。

其次,在特定测试套件的兼容性上,@OmedVibeCodes 观察到Pi 套件在DeepSeek 上的运行表现逊于 OpenCode,显示出不同基准下的适配差异。

此外,当前 V4 Flash 尚不支持原生的多模态视觉输入,处理图文混排任务时仍需借助外部模型进行前置解析。

因此,在真实的生产架构中,V4 Flash 更适合承担80% 高频、常态化任务的基础引擎角色,而极端复杂的难题仍需交由规模更大的旗舰模型处理。

04灰度中的 V4 Pro 提前亮相:"矿泉水掺顶级茅台"

在 Flash 模型凭性价比引发关注的同时,正在小范围灰度测试的旗舰模型 V4 Pro GA 正式版也引发了讨论。

开发者 @BoxMrChen 仅用4行提示词,要求模型融合《我的世界》与《无人深空》的核心机制编写一款 Web 网页游戏。V4 Pro 经过深度推理,以约0.1美元的 Token 成本生成了包含任务树系统、物品合成逻辑与资源采集的可玩游戏。

打开网易新闻 查看精彩图片

开发者 @mirochill 在复杂 Bug 修复测试中表示,针对《鱿鱼游戏》机制的代码构建中,V4 Pro 只经历2次自我迭代就修复了深层逻辑缺陷,连续输出3000行代码,总成本仅0.12美元,表现足以正面抗衡 Fable 5和 GPT-5.6 Sol。

打开网易新闻 查看精彩图片

开发者 @Waguri_Kaoruko8补充称,新版 V4的推理思维链(CoT)能够自动梳理出"编写主要场景代码……""生成核心逻辑……"等节点,可读性有所提升。

打开网易新闻 查看精彩图片

然而,V4 Pro 展现出的生成能力,也在社区内引发了争议。

科技媒体 @TechFlowPost 报道称,有部分开发者称在调用 V4 Pro 生成复杂大厂级别代码时,发现其输出风格与某些高价旗舰模型(例如 Claude Fable 5)存在相似之处,甚至有用户称触发了疑似特定高价模型风格的安全拒绝响应,从而引发了后台是否采用了混合路由机制的猜测。

社区调侃该现象为"矿泉水瓶里掺茅台"。 需要指出的是,上述安全响应细节目前多为社区反馈,尚无官方的进一步复现说明。

打开网易新闻 查看精彩图片

面对社区的种种猜想,技术专家 @TeksCreate 从架构层面给出了分析。

V4 Pro 拥有1.6万亿的总参数规模(推理时单 Token 激活490亿),采用 MoE 混合专家架构。 其核心改进在于引入了混合注意力系统,将历史压缩(CSA)、超长文本压缩(HCA)与全保真跟踪(SWA)结合,使处理100万上下文时的计算量降至前代的27%,KV 缓存占用也大幅下降。

在性能上,V4 Pro 在 Codeforces 跑出3206分,SWE-bench Verified 达80.6%,1M 长上下文检索 MRCR 达83.5%。 @TeksCreate 认为,这些架构创新证明 V4 Pro 本身具备独立达到该水平的技术条件。至于模型在实际部署中是否使用了混合路由,在官方明确回应之前尚无定论。

打开网易新闻 查看精彩图片

05宏观市场重构:更多人负担得起的前沿 AI 生产力

从 V4 Flash 的正式公测到 V4 Pro 正式版的灰度亮相,DeepSeek 掀起的定价风暴正在全球开发者生态与市场预期中引发连锁反应。

对比当下主流厂商的定价策略,V4 Flash 每百万输入/输出 Token 0.14/0.28美元的价格,不仅让打折后的 GPT-5.6 Luna(输入0.20美元/输出1.20美元)感到巨大压力,更是对 Anthropic Haiku 4.5(输入1美元/输出5美元)形成了输入端便宜7倍、输出端便宜18倍的优势。

预测市场平台 Polymarket 的分析者 @goodworse 认为,V4 Flash 的出现将迫使前沿 AI 服务的综合使用成本进一步降低。

打开网易新闻 查看精彩图片

0xSupergemma 创始人宋骏(Jun Song)从全球经济视角分析指出,全球有相当庞大的低收入群体与初创团队无法直接承担高昂的模型订阅费。DeepSeek 极低 API 定价的意义,在于能够通过下游开发者转化为极其便宜的 SaaS 工具、应用与服务,间接让更广泛的终端用户享受技术红利,成为降低 AI 生产力门槛的重要选项之一。

打开网易新闻 查看精彩图片

《财富》杂志分析指出,DeepSeek V4的研发与发布与华为底层芯片生态进行了紧密适配。 随着华为昇腾系列处理器软硬件协同效率的提升,未来模型推理成本还有进一步下探的空间。DeepSeek 展现出的成本优势,背后是算法架构重构与本土硬件生态适配共同作用的结果。

结语

综合官方测试集数据、权威第三方交叉验证以及一线开发者的真实反馈,DeepSeek V4 Flash 展现出的核心价值,并不在于要在每一个实验室单项榜单上都拿下第一,而在于它以一种务实的方式,重构了智能体与代码开发中的成本账单。

在现代智能体软件工程中,一个看似简单的自然语言指令,往往需要拆解为意图理解、环境感知、文件检索、工具调用以及多次代码生成与自我修正,调用的乘数效应会瞬间放大 Token 消耗。

V4 Flash 在中等努力水平下的稳定性、对 Codex 接口的无缝集成以及高额缓存折扣,为开发者提供了一个能够支撑大规模日常调用的基础选项。

当越来越多的企业财务官与开发者开始精细化计算 API 账单时,答案已经很明确:前沿智能的价格,正在被重新定义。