8 月 25 日发布,9 月 22 日发售,RMB 6,999 起。苹果这次把 M6 Mac mini 的宣传重心压在了本地 AI 上:2nm 制程、双 16 核神经网络引擎、GPU 里第一次内置神经网络加速器、AI 性能比 M4 最高提升 4 倍。

先给结论。如果你买它主要是为了本地跑大模型,芯片参数基本可以忽略,真正决定体验的只有两个数字:统一内存容量,和内存带宽。而这两个数字,苹果在宣传稿里都没讲全。

一、四款机型,一张表看明白

苹果中国官网的技术规格页列了四个机型,我按本地 AI 相关的项做了整理:

机型

起售价

芯片

统一内存

内存带宽

起始存储

雷电口

1

¥6,999

M6

16GB(可选 24/32GB)

153GB/s

256GB

3×TB4

2

¥8,499

M6

16GB(可选 24/32GB)

153GB/s

512GB

3×TB4

3

¥9,999

M6

24GB(可选 32GB)

170GB/s

512GB

3×TB4

4

¥12,999

M5 Pro

24GB(可选 48/64GB)

307GB/s

512GB

3×TB5

M6 芯片本身是 12 核 CPU(2 个超级核心 + 4 个性能核心 + 6 个能效核心)、12 核 GPU、双 16 核神经网络引擎,支持硬件加速光线追踪和 AV1 解码。M5 Pro 则是 15 核 CPU、16 核 GPU、16 核神经网络引擎,可加钱升到 18 核 CPU 和 20 核 GPU。

补齐各档位的实际售价:16GB/256GB 是 ¥6,999,16GB/512GB 是 ¥8,499,24GB/512GB 是 ¥9,999,32GB/512GB 是 ¥11,499,M5 Pro 24GB/512GB 是 ¥12,999。

其他值得一提的:Apple N1 无线芯片,Wi-Fi 7、蓝牙 6,还首次支持 Thread;2.5Gb 以太网,可选配 10Gb;机身 12.70×12.70×4.97 厘米,M6 版重 0.67 千克;最大持续功率 155 瓦,闲置噪音 5 dBA。

二、三个数字,苹果没大声说

第一个:16GB 版的带宽是 153GB/s,不是 170GB/s。

宣传稿里那句「最高可达 170GB/s」,那个「最高」是有条件的。翻到官网技术规格页才写得清楚:配 16GB 统一内存时带宽是 153GB/s,只有升到 24GB 或 32GB 才是 170GB/s。差 11%。

为什么这事重要?因为跑本地大模型时,决定「吐字快不快」的瓶颈通常不是算力,而是内存带宽。模型每生成一个 token,权重就要被完整读一遍。买 16GB 基础款的人,是同时输掉了容量和带宽两样东西。

第二个:内存最高 32GB,而且出厂焊死。

M6 版的天花板就是 32GB。SSD 不够可以外接,机器慢了可以忍,内存不够是整个工作流当场停摆,而且后期没法补。

第三个:M6 版是 Thunderbolt 4,不是 Thunderbolt 5。

这一点最容易被忽略,但它直接决定了一整条路线的生死。M6 机型背面是三个雷雳 4 口(40Gb/s),只有 M5 Pro 机型才是三个雷雳 5 口(120Gb/s)。

后面会讲到,多台 Mac 组集群跑大模型,最关键的 RDMA over Thunderbolt 5 需要 TB5 才能开。M6 版走 TB4,只能回落到 TCP/IP,跨机通信慢一个数量级。想玩集群,M6 这台机器从硬件上就被挡住了。

三、为什么带宽比算力重要

本地推理有个反直觉的地方:它基本是个「搬运」活儿,不是「计算」活儿。

生成一个 token 的过程,本质上把模型权重从内存搬到计算单元过一遍。所以吞吐量的上限约等于「内存带宽 ÷ 模型权重大小」。这也是为什么一台 12 核 GPU 的 Mac mini,在某些场景下能追平看起来规格高得多的显卡。

三条可以直接用的经验法则:

  • Q4 量化下,每 10 亿参数约占 0.5 到 0.6GB
  • macOS 默认不会把全部统一内存交给 GPU,实际能给模型的大约是 70% 到 75%
  • 别把模型权重顶到内存上限,要给系统、推理软件和 KV Cache 留 25% 到 30% 的余量

按这个算,三档内存的实际可用空间大概是:16GB 约 11 到 12GB,24GB 约 18GB,32GB 约 24GB。

四、三档内存,各能跑什么

档位

能流畅跑

勉强能跑

跑不动

适合谁

16GB

7B 到 9B 级(Qwen3 8B、Qwen3.5 9B)、Whisper large

12B 到 14B Q4,需关掉所有后台,长上下文容易爆

27B 及以上

以办公为主,偶尔体验本地 AI

24GB

7B、14B 全系列,Gemma 4 12B 多模态

Qwen3.8-27B Q4,上下文不能拉太长

32B 原生

绝大多数人的最优解

32GB

7B/14B 常驻,27B 量化稳定,可同时挂 1 到 2 个 Agent

部分 32B 量化,速度一般

无压缩 32B

长期挂本地服务的深度玩家

具体到模型和估计速度(Q4 量化、中等上下文):

16GB 档:Qwen3 8B(约 6.5GB,估 28 tok/s)、Qwen3.5 9B(约 7GB,估 25 tok/s)、Gemma 4 12B 4bit(7 到 8GB,约 20 tok/s)、gpt-oss-20b MXFP4(约 12GB,MoE 架构省算力)、Whisper large(3 到 4GB,转录比实时快)。

32GB 档:Qwen3.8-27B 4bit(约 18GB,8 到 12 tok/s)、GLM-4.7-Flash 4bit(约 19GB,MoE 只有 3.6B 激活参数)、Qwen3-Coder-30B-A3B 4bit(约 19GB,256K 上下文,在 MLX 上很快)。

跑不动的那栏要单独说清楚。GLM-5.3-Flash 有 3200 亿参数,DeepSeek V4 Flash 光权重就 167GB,这些需要 170GB 以上的内存。一台 M6 Mac mini 连边都摸不到,就算压到极限量化也不行。想要真正对标付费服务的模型能力,这台机器的定位就够不着。

五、四个真实案例

案例一:Jeff Geerling 的 Mac Studio 集群。

苹果直接提供了一组 Mac Studio 给他测 RDMA over Thunderbolt 5。4 台 M3 Ultra、合计 1.5TB 统一内存,跑 Qwen3 235B 达到 32 tok/s。

最有意思的是对照组。同样的硬件,用 llama.cpp 做分布式,从单机的 20.4 tok/s 掉到 4 机的 15.2 tok/s,加机器反而更慢。换成 exo 加 RDMA,是单机的 19.5 tok/s 涨到 4 机的 31.9 tok/s,方向完全相反。差别就在互联:RDMA 把跨机内存访问延迟从约 300 微秒压到 50 微秒以下。

代价是这套集群总成本接近 4 万美元。

案例二:exo 官方基准测试。

LLaMA 3.2 3B 跨 M4 Pro 机器:1 台 49.3 tok/s;2 台单请求 44.4、多请求 95.7;3 台单请求 39.7、多请求 108.8。

看明白了吗?单请求延迟是随着加机器变差的,每一次跨机跳转都在加网络开销。但总吞吐能到 3 台 2.2 倍。官方 README 给的张量并行加速是 2 设备 1.8 倍、4 设备 3.2 倍。所以集群的价值在多并发,不在单条对话更快。

案例三:Alex Cheema 的 8 台 Mac mini。

exo 的联合创始人演示过用 8 台 M4 Pro Mac mini(每台 64GB,合计 512GB)跑 DeepSeek V3 671B。最初约 5 tok/s,优化后 2 节点 27.8 tok/s、4 节点 32.5 tok/s。

注意这里用的是 M4 Pro,因为要 TB5。换成 M6 版 Mac mini,这条路走不通。

案例四:长上下文会崩。

独立测评者 Ivan Fioravanti 用 2 台 M3 Ultra 512GB Mac Studio 跑完整 8bit 的 DeepSeek R1 671B:442 token 上下文时 18.6 tok/s,1074 token 时降到 15.4,13140 token 时只剩 6.4,到 16K 直接内存耗尽。

这是官方基准很少强调的一条:短提示很好看,长对话会断崖式掉速。买机器之前,先想清楚你的场景是短问答还是长文档。

还有一个更接地气的参照。有人用 M4 16GB 的 Mac mini 日常跑 Qwen3.6-35B-A3B,llama.cpp 和 Ollama 约 17 tok/s、活跃内存仅 3GB、零 swap;换成 LM Studio 的 MLX 版本能到 25 到 35 tok/s,但驻留内存涨到 10 到 12GB。17 tok/s 已经够用了,算是「对话级」而不是「阅读级」。

六、怎么部署:四个工具选一个

Ollama,最省心。装完一行命令就能跑,ollama run qwen3:8b 自动下载并启动,同时在 localhost:11434 提供 OpenAI 兼容 API,可以接各种前端和应用。2026 年的版本已经全面接入 MLX 后端,预填充和解码速度比旧版提升近一倍。新手建议从这里开始。

LM Studio,图形界面最友好。不想碰终端就选它,鼠标点几下就能搜模型、下载、切换,也自带 OpenAI 兼容的本地服务。

MLX,Apple 官方框架,速度最快。苹果为 Apple Silicon 专门写的,在统一内存上效率最高。想压榨速度、或者做 LoRA 微调,用这个。命令是 pip install mlx-lm,然后 python -m mlx_lm.generate --model mlx-community/xxx --prompt "..."。注意一点:mlx-lm 目前还不支持 tool calling,所以要做能读写文件的编码 Agent,得用 llama.cpp、Ollama 或 LM Studio。

llama.cpp,控制力最强。从源码编译带 Metal 支持,可以精细调线程数、batch size、上下文长度。典型命令是 ./llama-cli -m model-q8_0.gguf -c 8192 -ngl 99,-ngl 99 是把所有层都卸载到 GPU。

一个实战里总结出来的小技巧:用 Ollama 让模型常驻后台,别随便杀进程。冷启动第一次请求要等 5 到 10 秒,热的页面留在缓存里,后续请求会快很多。

七、我的购买建议

只是办公,偶尔玩一下:16GB 够用,硬盘按需。但如果你买这台机器的主要目的就是本地大模型,别买 16GB,它是同时输掉容量和带宽的一档。

想认真跑本地模型:直接上 24GB,硬盘 512GB 起步。这是真正的甜点档,一次性同时买到更大的容量和完整的 170GB/s 带宽,也是绝大多数人的最优解。

长期挂本地服务、多模型切换:32GB。M6 的天花板,能常驻 27B 量化模型。

要跑原生 32B,或者想组集群:M6 满足不了。要么上 M5 Pro 版 Mac mini(最高 64GB、307GB/s、TB5),要么上 Mac Studio(M5 Max 基础 36GB、最高 128GB、460GB/s 带宽、四个 TB5 口)。

最后提醒一句:内存一定要在下单时选对,后期没法加。硬盘反而可以先抠一点,模型文件放外接 SSD 就行。

M6 Mac mini 值不值得买,取决于你怎么定义它。

它不是「穷人的 H100」,甚至不是一台 AI 工作站。散热比笔记本好、功耗 155 瓦封顶、闲置 5 dBA 几乎听不见,这些加起来的真正定位是:一台可以 7×24 小时开机、放在办公桌角落的个人私有推理节点。

在这个定位上,24GB 那档 ¥9,999 的机器,能给你一个完全离线、数据不出门、随时可调用的 14B 级模型。这个能力在三年前还得靠几万块的设备。

而如果你要的是替代云端的前沿模型能力,那答案很直接:这台机器做不到,加钱也做不到。真正的分界线在 32GB 到 128GB 之间,不在 M6 这一代 Mac mini 上。