作者:伯衡君

打开网易新闻 查看精彩图片

本地运行 DeepSeek V4 Flash:无需 GPU 真好啊

概述

2026年7月31日,DeepSeek 发布了 V4 Flash 模型,参数规模达 2840 亿,每次推理激活 130 亿。

发布后仅 4 小时 54 分钟,Unsloth 就推出了本地运行版本,让这款前沿级代码模型可以在普通桌面电脑上运行。

DeepSeek 官方声称该模型在 SWE-bench 得分从 4 月的 7.3 提升至 54.4,超越了自家 1.6 万亿参数的主打模型。

然而,所有九项 Agent 评分都来自 DeepSeek 内部测试,外部无法复现。

本文将解析模型技术细节、本地运行配置要求,以及这些数字背后的真实性问题。

模型发布与性能争议

打开网易新闻 查看精彩图片

DeepSeek V4 Flash 于 7 月 31 日 UTC 时间早上 7:30 发布模型权重,当天下午 12:24(仅 4 小时 54 分钟后)Unsloth 就推出了可在本地运行的版本。这个时间差本身就值得关注:一个前沿级代码模型从发布到可以在普通电脑上运行,只用了一顿饭的功夫。

该模型拥有 2840 亿参数,每次推理激活 130 亿。DeepSeek 官方发布的模型卡片声称在 SWE-bench(软件工程 Agent 基准测试)上得分达 54.4,而其 1.6 万亿参数的主打模型仅得 7.3。同一模型,仅因训练方式不同,分数就大幅提升。

然而,Terminal Bench 是公开的代码 Agent 排行榜,包含 89 个真实任务。Claude Code 配 Fable 5 得分 83.8 排名第一,DeepSeek 声称的 82.7 理论上可排第三,但该模型并未出现在公开榜上。

关键问题在于:DeepSeek 公布的所有九项 Agent 分数都来自其内部测试环境,而非第三方验证。Artificial Analysis 的独立测试显示该模型在 Intelligence Index 上得分 50(101 个模型中排第三),但这测的是推理和知识能力,而非 Agent 任务完成能力。

技术架构:混合专家模型

DeepSeek V4 Flash 采用混合专家(Mixture of Experts,MoE)架构,这是其能在消费级硬件上运行的关键。每个 Transformer 层包含一个共享专家和 256 个路由专家,而每次推理只激活其中 6 个专家。这种设计让模型在保持强大能力的同时大幅降低计算成本。

技术报告中两个关键细节常被忽视:首先,每个专家的中间维度仅为 2048,相比传统大模型小得多;其次,前三层混合完全不学习路由策略,而是使用固定哈希分配。这意味着模型架构在训练初期就已高度优化,减少了需要学习的参数量。

模型权重的存储也经过特殊处理:2970 亿参数以 4 位量化存储,60 亿以 FP8 存储,15 亿以 BF16 存储。97% 的权重在磁盘上已是低精度格式。DeepSeek 没有先训练 16 位模型再压缩,而是直接从 4 位开始训练,这解释了为何 8 位版本只比 4 位大 7GB(而非传统的翻倍)。

本地运行配置与性能

打开网易新闻 查看精彩图片

Unsloth 在发布当天就提供了 13 种量化版本。

打开网易新闻 查看精彩图片

1 位量化版本仅需 82.5GB 存储空间,2 位约 91GB,3 位 104-128GB,4 位 155GB,8 位 162GB。最推荐的是 3 位版本(110GB),这是大多数桌面电脑可以承受的规模。

打开网易新闻 查看精彩图片

所有版本均采用 MIT 许可证,可商用、修改和再分发。

实际运行性能数据:128GB 内存的 M5 Max MacBook Pro 运行 2 位量化版本,生成速度达 34 tokens/秒,前填充速度 87 tokens/秒;M3 Max 相同配置下为 26.5 tokens/秒;512GB 内存的 Mac Studio 运行 4 位版本达 35.5 tokens/秒。这些速度超过了人类阅读速度,具备实用价值。

但需要注意前填充性能会随上下文增长而急剧下降。M5 Max 在 11,700 tokens 上下文时,生成速度从 34 降至 26 tokens/秒。对于完整代码库分析,速度下降明显。

7 月 7 日 llama.cpp 引入的量化 KV cache 是让长上下文在小内存设备上运行的关键技术。

与 Claude Code 和 Codex 集成

打开网易新闻 查看精彩图片

llama.cpp 服务器现已支持 OpenAI 的 chat 和 responses 端点,以及 Anthropic 的 messages 端点。这意味着本地运行的 DeepSeek V4 可以直接集成到主流 AI 编程工具中,实现完全本地化的开发环境。

与 Claude Code 集成的配置非常简单:将 anthropic_base_url 指向本地 localhost 即可。对于 Codex,需要在配置文件中添加 provider 块,指向 llama 服务器端口,并将 wire API 设为 responses。配置完成后使用 off profile 运行 Codex。

关键配置参数:温度设为 1.0,Top P 在对话任务用 0.95,Agent 工作用 1.0。Reasoning effort 默认高,Max 模式需要 38.4 万 token 上下文,对于 128GB 内存机器来说无法达到,因此大多数情况下不应开启 Max 模式。

一个重要提醒:V4 没有内置聊天模板,使用独立的 Python 编码器。Unsloth 重建了模板并在 4000 个对话上测试过。如果本地运行到第三轮开始输出乱码,通常是 llama.cpp 需要更新,或 GGUF 文件需要重新下载。

硬件成本与行业趋势

本地运行 DeepSeek V4 Flash 的真正瓶颈不是模型权重,而是内存。

162GB 内存需求在 2024 年初还是无需 Care 的,但到了 2026 年已成为真正的消费。这是因为半导体行业正在发生结构性变化:DRAM 制造商将晶圆产能转向 AI 加速器用的高带宽内存(HBM)。

Gartner 预测 2026 年 DRAM 和 SSD 综合价格将上涨 130%。

打开网易新闻 查看精彩图片

通过 API 调用 DeepSeek V4,每百万 tokens 只需不到1块钱。

本地运行则是一次性购买内存成本,获得约 30 tokens/秒的生成速度,并且可以自己验证模型真实性能。

伯衡君的建议是:已有大内存机器的用户值得下载尝试,没有的话使用 API 更经济。

篇后寄语

DeepSeek V4 Flash 是首个可在消费级硬件上运行的前沿级代码模型。2840 亿参数、激活 130 亿的设计,配合 MoE 架构和精细量化,实现了在家用电脑上运行最强 AI 编程助手的目标。

模型性能数据存在外部验证问题。DeepSeek 公布的九项 Agent 分数均来自内部测试,Terminal Bench、Cyber Gym、SWE-bench 等公开基准无法复现。第三方独立测试仅确认了模型的推理能力(Intelligence Index 排第三),而非 Agent 任务完成能力。

硬件瓶颈已从模型转向内存。162GB 本地运行需求遭遇 DRAM 价格暴涨(2026 年预计上涨 130%),苹果停售 512GB Mac Studio,内存已成为比模型权重更大的门槛。

从行业背景看,AI 推理本地化正在加速但面临硬件供应链挑战。HBM 需求激增导致传统 DDR5 内存短缺和价格上涨,2027 年前难以缓解。这可能促使更多用户转向 API 调用,而非本地部署。

个人分析认为,DeepSeek V4 Flash 的发布模式代表了 AI 开源的新阶段:模型权重快速开放,量化技术持续进步,但硬件成本成为实际使用的决定因素。关键洞察是:模型的「可运行性」不仅取决于参数规模,更取决于量化技术和硬件适配的成熟度。

实用建议:确认已有 128GB 以上内存再考虑本地部署;3 位量化(110GB)是性价比最高的选择;配合 llama.cpp 和量化 KV cache 可实现更长上下文;将模型测试任务设定为自身代码库的 10 个具体问题,这比任何第三方基准都更有参考价值。

概念释义

DeepSeek V4 Flash:中国 AI 公司 DeepSeek 发布的开源代码模型,2840 亿参数,MoE 架构,7 月 31 日发布后由 Unsloth 快速适配本地运行。

MoE (Mixture of Experts):混合专家架构,每个推理只激活部分专家而非全部参数,大幅降低计算成本。

量化 (Quantization):将模型权重从高精度(16/32位)压缩到低精度(1-8位)存储的技术,大幅减少内存和计算需求。

Unsloth:专注于 AI 模型量化的开源项目,在模型发布数小时内提供本地运行优化版本。

KV Cache:Key-Value 缓存,AI 推理时存储已计算过的注意力键值,避免重复计算,是长上下文的关键优化技术。

引用资料

涉及技术:DeepSeek V4 Flash、MoE、量化、Unsloth、llama.cpp、Claude Code、Codex

延伸阅读:Unsloth 官方 GitHub 仓库、DeepSeek 技术报告、llama.cpp 文档、以及 Terminal Bench 2.1 公开排行榜

以上,既然看到这里了,如果觉得不错,随手点个赞、收藏、转发三连吧,如果想第一时间收到最新黑科技,敬请关注伯衡君。

谢谢你看我的文章,我们,下次再见。