苹果这周发了台新机器。Mac Studio,M5 Ultra 芯片,中国售价 46999 元起。
差不多五万块。能买台不错的二手车。但这台机器配了 512GB 统一内存,1.2TB/s 带宽,每个 GPU 核心塞了神经网络加速器,AI 计算性能比上代快 4.3 倍。这些参数合起来干的事就一件:在本地跑以前只在云端跑的大模型。
512GB 是什么概念。你手机大概 12GB 内存。顶级游戏显卡 RTX 4090 显存 24GB。NVIDIA 专跑 AI 的 H100 一张 80GB,想装下千亿参数模型得买八张绑一起,光卡就几十万。
苹果的办法是统一内存。M5 Ultra 的系统内存和显存不分家,512GB 一台机器全包。不用装机柜,插电就跑。机器本体只有 19.7 厘米见方、9.5 厘米高,搁桌上不占地方。
HN 这条新闻底下 408 条评论,点赞最高的一批全在聊本地跑模型的实测数据。Llama 70B 压缩后跑 30 到 45 token 每秒,Qwen 72B 跑 28 到 40,日常用够快了。有人把 DeepSeek 671B 压到 2-bit 塞进去了,虽然只跑 15 到 25 token 但确实能跑。
以前你花钱让云端帮你跑的活,这台机器搁家里能跑了。
那 OpenAI 的月费还交不交。
分人。
你偶尔用用 AI 写写邮件改改文案,ChatGPT Plus 一个月 20 美元,一年 240 美元。花几万块买台机器一周用三次,钱花得冤。
天天跑大模型的,或者小团队拿 AI 当生产力工具的,账就不是这么算了。HN 上有个做 AI agent 平台的创业者说了句话:他现在能跟客户说不用交 OpenAI 的 API 费了,这台机器一年回本。一个天天跑 agent 的团队,API 费一个月几百到几千美元。M5 Ultra 基础版 5499 美元,按每月 500 美元 API 费算,11 个月回本。按每月 2000 美元算,3 个月回本。机器买断能用三五年,月费用完就没了。配一台等效的 NVIDIA 工作站跑大模型,一块 H100 单卡几万,八卡服务器整机几十万还得自己组装维护。HN 那边有人算过,同样能跑满血大模型的设备,Mac Studio 比 NVIDIA 便宜 30% 到 50%。
但本地跑真正值钱的不是省钱。
你的数据不出门。律师所、医院、会计师事务所,这些行业有保密合规要求,客户数据不能往云端传。以前想用 AI 合规卡着不让用,现在本地跑没人管得着。飞机上、信号差的地方、对网络稳定性有要求的生产环境,云端 AI 断网就停。本地的不停。跑多少都不多收一分钱,不限速不限量,半夜想跑多少跑多少。macOS 去年 12 月更新还支持了分布式推理,多台 Mac 用雷雳 5 连一起共享内存。四台 Mac Studio 绑一起,AI 推理速度能到单台的三倍。苹果在这块生态上布局得很明显。
但别急着掏钱。
512GB 满血版 18299 美元,折合人民币十三万多,10 月才出货。基础版只有 96GB 内存,跑 Llama 70B 够用,想跑 DeepSeek 671B 这种巨无霸得加钱上大内存。苹果内存贵是出了名的,升级内存的钱在外面能买好几条同容量内存条。但统一内存架构就这样,你没法自己加,只能跟苹果买。今年 DRAM 涨价,苹果全线涨价,M5 Ultra 比 M3 Ultra 发售时贵了 200 美元。
软件这块,苹果自己的 MLX 框架跑得最快,但对普通用户门槛高。Ollama 一行命令拉模型就能跑,适合有点技术的。LM Studio 有图形界面,没用过命令行的人也能上手。三款工具今年都更新了 MLX 后端,速度比半年前快了不少。但跟云端比,本地配环境还是麻烦,这点别忽悠人。
HN 上有人聊到这个用法:你是个小公司的运营,每天要把销售数据整理成周报发给老板。以前导数据到 Excel,手动做透视表,写总结,发出去。现在让本地的 Qwen 72B 直接读你的 CSV 文件,生成表格加一段总结,十五分钟干完以前两小时的活。数据没出过公司,合规没问题,没花一分钱 token 费。天天这么干,一年省下的 API 费够买两台基础版 Mac Studio。
意大利有个写 Redis 的大佬 antirez,自己搞了个叫 DS4 的本地推理框架,跑 DeepSeek V4 Flash 量化版,跟 Claude Code 兼容。他那个项目 10 天拿了一万多颗星。大厂之外的人在往这条路上挤。苹果同一天还发了台 Mac mini,M6 芯片,2 纳米工艺,起价 899 美元。16GB 内存跑不动大模型,但买四台绑一起能组集群。Mac mini 试水本地推理入门,Mac Studio 守住高端 AI 计算。苹果一年内把整套本地 AI 工具链铺齐了。
这两年开源模型跑出来的速度比云端闭源的还快。DeepSeek 671B 量化版本地就能跑,Qwen 72B 已经追得上 GPT-4 多数任务,Llama 3.3 70B 在代码生成上比去年那版强了不止一档。本地能跑好用的模型越来越多,这是 Mac Studio 这种机器能成事的根本。要是开源模型还停在三年前的水平,硬件再好也没用。
到底该不该买。天天跑模型的,现在可以认真考虑了。数据不出门、不交月费、断网也能跑,对很多人来说值五万块。偶尔用用的,继续交月费,别跟风。
苹果在这件事上占了个便宜,它没跟 OpenAI 正面竞争,一个卖硬件买断,一个卖服务收月费。但硬件买断能覆盖大部分使用需求的时候,月费那边的账就不好算了。M5 Ultra 的宣传重点是 AI 计算、本地推理、开放权重模型,条条冲着云端 AI 服务的生意。
512GB 这条线过了,本地 AI 就算到站了。后面只会越来越便宜越来越快。买不买看你用量,但这个方向是定的。
热门跟贴