去年冬天我在中关村电子城转悠,想给实验室配台本地推理机,结果在一家不起眼的柜台前被拦住了——店员推过来一台巴掌大的黑盒子,说:“你试试这个。”我下意识摸了摸机箱背面,确认没插显卡,也没听见风扇声。接上电,连上显示器,敲了行ollama run llama3:70b,五秒后,文字开始往下滚……不是卡顿着蹦,是真·瀑布流。我愣了三秒,回头问:“这玩意儿……没连云?”

打开网易新闻 查看精彩图片

原来它叫阿迈奇星核M1A PRO+ 395,整机就4.48升,比两本《现代操作系统》叠一块还小。但它把CPU和GPU塞进同一套内存池里,拉出128GB统一内存,其中96GB能当显存用。你没看错,96GB——是RTX 4090那24GB显存的整整四倍。更魔幻的是,它不用液冷,不占机柜,插电就能跑120B参数的GPT-OSS模型,实测44.42 token/s。什么概念?你问“请用文言文写一封辞职信”,它还没等你松开回车键,全文就齐活了。

打开网易新闻 查看精彩图片

我拿它跑了好几轮测试:DeepSeek-R1 1.5B只吃2.7GB内存,输出狂飙到94 token/s;换到7B版本,26.7;14B掉到13.2;32B还能稳住6 token/s——差不多每秒六七个字,够你边喝咖啡边查财报边改PPT。最让我坐直身子的是那个70B Llama:划96GB显存后,4.41 token/s。这速度,放两年前,得两块A6000+双路EPYC,机箱塞满、电费跳表、散热器嗡嗡吵得人没法思考。

打开网易新闻 查看精彩图片

现在呢?它就坐在你书桌右下角,静音,发热量比路由器高不了多少。金融从业者拿它跑投研报告,不传云端;高校老师带学生调模型,数据锁死本地;连我邻居家高中生,上周拿它搭了个古诗续写bot,还顺手把《滕王阁序》续到第三段……没人再提“显存不够”这四个字了。对吧?这年头,连120B模型都能在迷你主机里喘匀气,AI哪还有什么门槛可言。

打开网易新闻 查看精彩图片

(我上个月试完,当场把云API账单取消了)