华硕ROG Flow Z13在我办公室的三台Strix Halo设备里,原本是干AI活最少的那台——实际上它什么活都没干,一直在玩《死亡搁浅2》。但自从我在其他所有跑LLM的设备上装了Lemonade之后,我想看看这台平板到底能有多大能耐。 毕竟它和那些迷你PC用的是同一颗强大的APU,拥有128GB统一内存。那些迷你PC现在跑着我的Proxmox服务器和家里实验室的主LLM服务器。但这次我想玩点不一样的——能跑重型模型,不代表你想用它干所有事。这就像那句老话:手里只有锤子,看什么都像钉子。但有了Lemonade,我可以设置一个模型路由器,让重活儿交给120B的猛兽,其余任务则分流给越来越小的LLM。现在,它成了我做agentic编程时最想拿起来的PC。 和迷你PC同款的强力APU,塞进了平板里 128GB统一内存,选择权在你手里 这台Z13不只是128GB的Ryzen AI Max+ 395,而是和小岛制作联名的Ludens特别版。没错,就是那个大名鼎鼎的游戏作者小岛秀夫。它科幻感十足,在上面跑LLM毫无违和感。Radeon 8060S核显在AMD Adrenalin软件里划走了96GB内存——这让一台二合一平板变成了和我桌面级设备跑同样模型的LLM猛兽。 最顶级的那个档位,每次用都让我忍不住咧嘴笑。120B模型是个56GB的文件,这台平板加载它只要27.6秒,开始回答只需0.86秒,生成速度达到每秒52.03个token。这个数字放在任何设备上我都满意,而它居然出现在一台平板上——这永远不会过时。 而且因为有这么大的内存,四个档位的模型可以同时驻留内存。85GB的模型权重就绪,等着喂给核显。有一回我不小心把路由器配错了,让120B跑了一个纯CPU基准测试,结果慢得像……

打开网易新闻 查看精彩图片