统一内存,才是本地 AI 的入场券
打开网易新闻 查看精彩图片
统一内存,才是本地 AI 的入场券

跑本地大模型有一个硬门槛:显存!

30B 参数的模型,Q4_K_M 量化后需要大约 18-20GB。70B 模型直接冲到 40GB 以上。普通显卡的显存天花板就在那里——RTX 4090 也就 24GB,跑 70B 得拆层,速度直接腰斩。

统一内存打破了这个限制。CPU 和 GPU 共享同一个内存池,模型有多大,你就给它多大。不用来回拷贝数据,不用操心显存溢出。

目前市面上买得到的统一内存 AI 主机,就三个选手:

Mac Mini M4 Pro — 苹果 Unified Memory,最高 64GB

AMD Strix Halo — AMD 统一内存方案,最高 128GB

DGX Spark — NVIDIA Grace Blackwell,最高 128GB

三台机器,三种架构,三个价格带。但如果你真的掏钱买,数字背后的真相远比表面复杂。

价格差在哪

先看价格:

机型

起售价

统一内存

每 GB 成本

Mac Mini M4 Pro

~$600(16GB)/ $1,800(48GB)

64GB 封顶

~$28/GB

AMD Strix Halo

~$1,500(128GB 版)

128GB

~$12/GB

DGX Spark

$4,700(128GB)

128GB

~$37/GB

纯看内存性价比,Strix Halo 的 128GB 只要 $1,500,每 GB 成本只有 Mac 的一半、DGX 的三分之一。

但内存只是存储介质,你买的是它能跑多快。

真正拉开差距的指标

我用了同一个模型(Qwen3-Coder 30B,Q4_K_M),同一个后端(llama.cpp/Ollama),在完全相同的条件下测了三台机器。

结果让人意外:

机型

预填充速度

生成速度

价格

Mac Mini M4 Pro

564 t/s

56 t/s

~$600(16GB 版)

AMD Strix Halo

342 t/s

73 t/s

~$1,500(128GB 版)

DGX Spark

2,107 t/s

84 t/s

$4,700(128GB)

生成速度 ——你看着文字逐字出现的那一列:

Mac Mini 56 t/s,Strix Halo 73 t/s,DGX 84 t/s。最贵的和最便宜的之间只差 28 token/s。你阅读中文的速度大概在 20-30 字/秒,换算成 token 也就 15-20 t/s。这三台机器生成速度都比你读得快,聊天体验几乎没有区别。

预填充速度 ——模型读取你输入上下文的速度:

这才是真正的分水岭。DGX 的 2,107 t/s 是 Mac 的 3.7 倍,是 Strix Halo 的 6 倍。如果你需要处理长文档、大量 RAG 片段、复杂 Agent 上下文,DGX 的预填充优势是碾压级的。

但问题在于: 大多数人需要的是预填充,还是生成?

性价比的真相

如果你只聊天、写稿、改代码,你的工作负载 90% 的时间都在生成速度那一列。在这列里,Mac Mini 的 56 t/s 和 DGX 的 84 t/s 体验差距微乎其微,但价格差了 7 倍。

那 Strix Halo 呢?128GB 只要 $1,500,生成速度 73 t/s 甚至比 Mac 还快,看起来是中间的最佳选择。但 ROCm 兼容性是个隐患——本地 AI 生态里很多库只支持 CUDA,碰到一个不支持的工具,你的 128GB 统一内存就只能停在"编译中"。

所以各场景的性价比之王其实是:

聊天、写稿、短提示 → Mac Mini M4 Pro

你用 $600 换来的体验和 $4,700 的 DGX 几乎一样。省下的 4,000 美元够你买一台不错的游戏本,再租几个月云 GPU 做重活。而且 Mac 的 MPS 支持在本地 AI 生态里已经相当成熟,该有的工具基本都有,功耗只有 20W,静音、免维护。

大上下文、RAG、长 Agent → DGX Spark

$4,700 值不值?看你用不用得上。如果你每天处理几十份文档的 RAG 检索,或者跑长上下文 Agent 工作流,DGX 的预填充优势是 Mac 无法替代的。在这类场景下,DGX 没有竞争对手。

既要跑模型又要玩游戏、还要跑 Windows → Strix Halo

128GB 内存 $1,500 确实香。但你必须接受 ROCm 的抽奖机制——遇到只支持 CUDA 的工具,你的体验会断崖式下降。对于愿意折腾的用户来说,Strix Halo 是潜力最大的硬件,但也是最需要耐心的。

一个你最容易忽略的变量

统一内存能跑多大模型,取决于你有多少内存。

30B 模型需要 18-20GB,70B 需要 40GB+,如果未来出现 100B+ 的开源模型,64GB 的 Mac 可能就不够用了。

Strix Halo 的 128GB 和 DGX 的 128GB 在这里是真正的优势——你不仅能跑现在的模型,还能跑未来一两年的模型。Mac 的 64GB 天花板,意味着你买的时候就限定了自己未来的上限。

但反过来, 大多数人真的需要跑 70B 模型吗? 30B 模型在推理能力上已经非常强了,而 70B 的推理速度在统一内存上会明显慢于 30B。为"未来可能"买单,和为自己"当前确实需要"买单,是两个不同的性价比计算方式。

一句话总结

统一内存跑本地大模型,性价比不是一条直线,而是三条:

Mac Mini :当下体验最好,价格最香,但内存上限低

Strix Halo :内存性价比逆天,但 ROCm 兼容性劝退小白

DGX Spark :预填充碾压,但 90% 的用户用不上这个优势,$4,700 严重超配

先问自己三个问题:你跑什么规模的模型?你的工作负载是吃生成还是吃预填充?你愿不愿意折腾生态兼容性?

那么最后答案出来,性价比自然也就就出来了。