作者 |Tofu
来源 | 至顶AI实验室
一台MacBook,两台Mac mini,再加上一台拥有128GB内存、硬件规格接近DGX Spark的NVIDIA AI小主机。
为了搭一套属于自己的AI,YouTube博主Manolo Remiddi的桌子上下已经摆满了电脑。
这件事最早并没有这么复杂。
四年前,他和很多人一样从ChatGPT开始使用AI。后来,他开始自己折腾Agent,希望有一个AI能够记住自己的信息、调用工具、写代码,甚至在自己睡觉的时候继续工作。
问题也随之出现。如果一个Agent能够读取文件、执行命令、访问客户资料,它还适合和自己的主力电脑放在一起吗?
为了回答这个问题,他先给AI建了一台虚拟机,后来干脆给它买了一台独立电脑。等到本地模型也跑起来之后,桌上的机器越来越多。最贵的一台,他花了3200美元。
这一路折腾下来,他真正关心的问题也逐渐发生变化:一台电脑到底装得下多大的模型,已经没那么重要;每天真正用起来时,模型够不够快、能不能长时间稳定运行、能同时带几个Agent,反而越来越影响体验。
一个Agent,让他多买了一台Mac mini
他最早的主力电脑是一台M1 MacBook Air,16GB内存。
电脑用了很多年,客户资料、工作文件和个人数据都在里面,同时还通过云服务同步到其他设备。
后来OpenClaw出现,他第一次真正做出了此前设想很久的个人AI系统。
在这之前,他已经花了大约9个月设计自己的Agent,包括长期记忆、状态管理、任务执行等模块。架构想了不少,真正实现起来却一直不顺利。
OpenClaw给了他一个现成的底座。几天时间里,他就在上面加入自己的记忆系统、状态机制和一个名为“Logician”的模块。
这个模块专门负责检查AI究竟有没有把事情做完,大模型给出的结果带有概率性。它可能说“文件已经创建”“任务已经完成”,实际情况未必如此。于是他让AI负责判断和执行,再用外部程序检查文件、状态和命令结果。
但他没有一开始就把OpenClaw装进自己的主力电脑。
Agent能读取文件,也能执行代码。再考虑到Prompt Injection、恶意程序和错误操作,他先在一台32GB内存的Mac mini里创建虚拟机,把Agent放进去测试。
系统跑顺以后,他又买了一台最基础的Mac mini M4:16GB内存、256GB硬盘。
这台电脑几乎只干一件事:跑AI。
OpenClaw、Hermes、OpenCode、Codex以及语音工具都常驻在里面。需要强模型时调用云端,需要本地模型时再把任务送到另一台机器。
对他来说,这台Mac mini更像一个AI的“值班室”,不用关机,不跟日常办公抢资源,Agent可以一天24小时待在那里。
128GB内存装下大模型,速度又成了问题
Agent有了自己的电脑,接下来轮到了模型。
16GB Mac mini也能跑本地模型,用来聊天或者处理简单任务没有太大问题。但代码越来越复杂、上下文越来越长之后,小模型很快就会碰到能力边界。
于是,他又花3200美元买了一台NVIDIA AI小主机。这台机器拥有128GB统一内存,硬件平台与DGX Spark接近,还可以通过高速接口连接更多设备。128GB给了他很大的模型选择空间。
真正开始用之后,另一个问题很快冒了出来。有些几十B规模的模型确实能够完整加载,生成速度却会明显下降。他测试过一个27B Dense模型。每次生成都要调用全部270亿参数,模型能力不错,实际速度大约只有10 token/s。
在他的使用习惯里,这已经有些慢了。尤其是写代码、和Agent连续交互时,人输入一句话之后还要盯着屏幕等输出,几轮下来就很容易打断工作节奏。
后来,他开始更多使用MoE模型。他目前经常使用的一个Qwen 35B级模型,每次实际只激活约3B参数。在这台机器上,生成速度能够达到约70 token/s。
另一个约27B总参数、4B激活参数的Gemma模型,也能跑到约50 token/s。
参数规模依然不小,真正参与一次计算的参数量却少了很多。
体验也随之发生变化。70 token/s已经很难让人明显感觉到等待,128GB内存还能留下空间给长上下文和多个模型实例。按照他的使用方式,在20万token上下文下,仍有机会同时运行两到三个Agent。一个负责聊天,一个持续写代码,另一个处理自动化任务。
到了这里,他开始把本地AI看成一套长期运行的系统:模型大小只是其中一个指标,速度、上下文、并发和稳定性都得一起算。
512GB能装更大的模型,也未必更适合每天用
继续往上加内存,看起来很容易成为下一步。比如Mac Studio可以提供数百GB统一内存。到了512GB,一些两三百B参数的量化模型也有机会直接装进去。
他却开始对这种配置产生犹豫,原因仍然是速度。如果一个250B模型成功加载之后,每秒只能输出几个token,那么“能运行”这件事本身,很难直接转换成工作效率。
这也改变了他选硬件的方法。他现在更倾向于在内存容量和运行速度之间找一个平衡。以自己的使用场景看,128GB已经能够容纳足够强的模型,也能留出长上下文和多Agent并发所需的空间,同时生成速度还可能维持在日常可接受的范围。
再往另一个方向看,他反而对RTX 5090这样的显卡越来越感兴趣。5090只有32GB显存,能装下的模型显然小很多,但显存带宽、CUDA生态和推理速度更有优势。对于20B到30B级量化模型,实际输出速度可能更适合高频交互。
至于代价,一张卡加上一套完整主机,很容易进入数千美元级别。如果堆到四张5090,虽然能获得128GB显存,整套系统的成本、功耗和散热都会迅速上升。
所以他的桌子上最后没有出现一台能够解决所有问题的“终极电脑”。MacBook继续负责日常工作,Mac mini负责让Agent全天在线,128GB NVIDIA主机承担本地推理,真正复杂的架构设计、代码审查和疑难Bug,再交给GPT、Claude这类云端模型。
他甚至开始反过来调整软件开发方式。如果一个项目大到本地模型无法一次读完,就把代码拆成多个相对独立的模块,让每个模块都控制在本地模型能够处理的上下文范围里。日常编码留给本地AI,需要全局判断的时候再调用更强的云模型。
至顶AI实验室洞见
四年前,他想解决的还是“怎样拥有一个自己的AI”。如今,这个问题已经变成了一张由多台电脑、多个模型和多个Agent组成的网络。有些机器负责思考,有些负责执行,有些一直开着,等着下一条任务。
这可能也是本地AI接下来更值得关注的变化。随着模型越来越高效,个人搭建AI系统的门槛正在从“买一台能塞下最大模型的电脑”,变成如何配置不同层级的算力。小模型处理高频任务,大模型解决复杂问题,Agent长期运行,云端模型只在必要时介入,每一层都有自己的位置。
硬件的价值也因此有了新的衡量方式。过去升级电脑,更多看CPU、GPU和内存能带来多少性能提升;到了Agent时代,还要考虑一台机器能否稳定运行几天甚至几个月,能同时维持多少个任务,以及模型生成速度能不能跟上人的工作节奏。参数规模依旧重要,但它只是整套系统中的一个变量。
更有意思的是,模型本身还在持续提高硬件的“上限”。新的MoE架构、更好的量化和推理优化,让同样128GB内存能够运行越来越强的模型。一台今天买下来的AI主机,未来能做多少事,很大程度上还取决于接下来会出现什么模型。
因此,他仍然没有停止升级这套系统。下一个准备放上桌面的硬件,是RTX 5090。
END本文来自至顶AI实验室,一个专注于对AI计算机、工作站及各类AI相关硬件设备,开展基于真实使用场景评测的研究机构。
热门跟贴