太快了。
周四上午,DeepSeek V4.1 Flash 正式在网页、App 和 API 端全面上线。
据官方披露,V4.1 Flash 在性能、响应速度、效率等核心指标上已全面超越 V4 Pro,且采用了新架构并原生支持多模态。
具体来讲,V4.1 Flash 是一款总参数规模达 552B 的 MoE 模型。它采用全新的 Causal-Encoder-Decoder 架构,并对输入与输出采用非对称计算设计:输入侧仅激活 8B 参数,输出侧激活 16B 参数,因此在保持大模型容量的同时,大幅降低了实际推理成本。
除了架构上的调整,V4.1 Flash 还引入了新的预训练方法,并进行了更大规模的强化学习后训练。最终,它在多项基准测试中实现了性能提升,整体智能水平超过大批当前旗舰模型,在性能、效率与成本之间取得了更好的平衡。
- 模型开源链接:
- https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- 论文链接:
- https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
从下图官方展示的基准结果来看,V4.1 Flash 在软件工程、网络安全环境和自动化任务等测试中表现较强
在 DeepSWE v1.1、CyberGym 和 Automation-Bench 上,它均取得图中最高分,其中 DeepSWE 仅以 0.2 分小幅领先 Opus 5;但在 Terminal-Bench 3.0 上,V4.1 Flash 的 30.0 分明显低于 Opus 5 的 43.3 分和 GPT-5.6 Sol 的 34.4 分。因此,整体来看,这组结果说明 V4.1 Flash 在部分 Coding 和 Agent 类任务上具备较强竞争力,但并非所有基准都占优。
下图为更全面的基准测试结果,可以看到,在 Coding、软件工程和 Agent 任务上明显提升之外,V4.1 Flash 在 GPQA Diamond、Terminal-Bench 3.0/4.0、ProgramBench 等项目上仍跟 GPT-5.6 Sol 或 Claude Opus 5 等顶级闭源模型存在差距。
DeepSeek 对于这个 4.1 Flash 是如此有信心,以至于早早发了公告要把 V4 Pro 砍掉。
V4.1 Flash 这次更新的另一条主线是把推理成本进一步压下来。分析它的「非对称」结构:
Agent 类负载的 token 结构极度倾斜,经常是几万 token 的上下文、工具返回、代码仓库前缀,换几十到几百 token 的输出。V4.1 的输入 / 输出比面向这样类型的任务改进,大幅度优化了总成本。
V4.1 Flash 针对缓存进一步做了压缩。按照官方数据,新一代模型的 KV Cache 大幅缩小,相比上一代对 HBM 的需求降至 1/4,对 SSD 的需求降至 1/8(已知 V4 一代的 KV Cache 已经只有 V3.2 的约 7% 了)。这一代 KV Cache 需求的质变,让同样的任务需要占用的高速显存和存储资源更少,也让长上下文、多轮调用这类任务的运行成本进一步下降。
值得一提的是,一个模型 API 会关心 SSD 需求,说明它的缓存分层里本来就把 SSD 当一级存储用。这是 DeepSeek 服务栈的一贯路线。
现在,每步要读的 KV 已经小到不再主导显存带宽,权重读取才是瓶颈,这才是社区测出 400 token/s、「速度不随上下文长度衰减」的原因。
9 月 14 日中午 12 时之后, V4 Pro 的 API 将下线,所有指向 V4 Pro 的 API 请求将被自动路由至 V4.1 Flash 处理,并按 Flash 系列降价后的单价计费:空闲时段输入缓存命中单价 0.02 元、输入缓存未命中单价 1 元,输出单价 4 元;高峰时段价格为空闲时段价格的 2 倍。
同时广大 C 端用户也获得了一次重大升级:在网页和 App 端,原来的快速、专家、识图三个模式已经全部合并,接入的都是 V4.1 Flash,现在可以用最先进的大模型开深度思考 + 搜索了。
另外,一些第三方的 Agent 工具、AI 平台也同步上线了新模型,比如 Workbuddy。
此前,OpenDesign 已经对 V4.1 Flash 进行了基准测试,至少在 OpenDesign Arena 这个基准上,其已经达到了世界第二,超过了 Fable 5.1,仅次于 Astra。
与新模型同步的还有 DeepSeek Harness v0.1.5,Web 界面支持上传包括图片、PDF 等类型的文件。
新版本与 DeepSeek V4.1 Flash 模型训练深度结合,模型在 DSH 不同配置中都进行了专项训练和优化。新版也为插件作者提供了更多标准化的 UI 扩展入口,新增了文件上传、侧边栏文件预览等功能,优化了 UI 的性能与交互,并增加了与模型研究前沿深度结合的实验功能。
新模型,大家用起来感觉怎么样?欢迎在评论区讨论。
热门跟贴