我以为自己捡到了一键部署智能体的大礼包。Beelink SER10 MAX迷你PC出厂就预装了OpenClaw,一切看起来像开箱即用。但当真正准备让它自主操作文件、浏览网页时,第一个选择就卡住了我:用云端大模型,还是本地跑模型?云端意味着更强智能,但也等于把控制权交出去;本地跑,心里踏实,却得直面硬件的真实斤两。

机器自带的模型是Qwen-3.5 9B,版本已经偏旧。想玩点更聪明的,只能自己动手。我把迷你主机的显存一口气划到48GB,心想这样载个大的应该不成问题。接下来就挑了Google Gemma 4 31B,选了个接近无损的量化版本,盘算着在本地也能享受一下“自主智能体”的丝滑感。

打开网易新闻 查看精彩图片

结果现实立刻给了一耳光。用llama.cpp跑起来,每秒只生成2.34个词元。日常查询平均要吐出116个词元,按这个速度,每次回复要等将近50秒。点个咖啡的功夫都够它回一句话,根本不是“助手”,而是“树懒”。这台机器用的是Ryzen AI 9 HX 470,内存只是DDR5-5600的速度,带宽完全不够一个大模型挥霍。就算把量化降到4比特,理论极限也不过每秒5个词元左右,日常用仍然难受。换成框架桌机那种Strix Halo系统或许还能打,可眼下这块硅片,就得认命。

深呼吸一下,我认了。Gemma 4 31B这级别不是为这种小个子准备的。乖乖换上Gemma 12B的Q4_K_M量化版,才是匹配它身板的理智选择。OpenClaw本身很有野心,技能系统让智能体能学会新操作,但到了硬件面前,所有花哨都得回归到“每秒几个词元”这行冰冷的数字上。