自从开始自己托管大语言模型以来,我一直在多台设备上折腾AI推理引擎。到目前为止,我的RTX 3080 Ti仍然是部署Qwen3.6-35B-A3B进行编码密集型任务的首选方案,配合MoE卸载技术使用。此外,我还在老旧的Pascal架构显卡上跑过Gemma-4-26B-A4B和GPT-OSS-20B,体验也还算不错。 然而,直到我开始研究单板计算机方案时,我才意识到某些边缘模型在日常生产力任务中能发挥多大的作用。最近,我决定在主力NAS服务器上部署几个AI模型,这次实验的效果非常好,以至于我已经开始用备份服务器来处理简单的LLM推理任务了。 我最终选择了LocalAI作为TrueNAS系统的LLM托管工具,它在这个ZFS NAS发行版上部署起来极其简单。 在讨论我在NAS上使用的LLM之前,先快速介绍一下NAS的规格和推理引擎。我主要使用的是一台TerraMaster F4-424 Max,安装了TrueNAS系统,用于备份、归档和文件共享,内存已经升级到32GB。但ZFS本身就需要占用大量内存,再加上自托管的应用程序栈也要吃内存,这次实验最多只能腾出8GB内存给AI推理用。 至于推理引擎,我有好几个候选方案。第一反应是llama.cpp,但它没有提供应用模板,要么配置成自定义Docker容器,要么在LXC中部署。我尝试用YAML代码部署llama.cpp的Intel变体,但容器总是因为检测不到处理器而启动失败。 为了省事,我转向了vLLM——另一个轻量级AI推理引擎。结果每次点击"启动"按钮,容器就会卡住,一直停在"部署中"状态。最后我决定试试LocalAI,出乎意料的是,在我分配好8GB内存之后,它的容器瞬间就部署成功了。
打开网易新闻 查看精彩图片
热门跟贴