html

问问骨灰级ChatGPT、Claude和Perplexity用户对本地大语言模型的看法,你会听到一大堆关于它们吃性能、设置复杂、算力拉胯的吐槽。然而,最常见的抱怨是自托管模型除了当聊天机器人,啥也干不了。讲真,在深入本地大语言模型生态之前,我也曾这么想,因为之前跟那些弱模型打过交道,结果不太满意。

但在我的工作站节点上测试了各种模型,并将它们与我家庭实验室中自托管的开源工具配对后,我了解到,只要配置到位,本地模型也能成为生产力神器。

你不需要将大语言模型工作负载限制在低参数模型上

你不需要将大语言模型工作负载限制在低参数模型上

这里的关键词是MoE分流

这里的关键词是MoE分流

很多人觉得本地模型不准、推理不行,这大多是误解,源于那些尝试自托管低参数大语言模型的人,而他们说得没错。除少数经过精细调整的模型外,大多数0.8B到4B的“铁疙瘩”,你让它们干点稍微带点技术含量的活儿,基本就是在胡扯。20B以上的模型推理能力明显强多了,但它们需要大量的算力。但重点是:你没必要非得用弱模型,只要调校得当,就算在老机器上也能跑得动大模型。谁说的?就是我自个儿,我现在就在一台十年前的老机器上跑着26B的模型!

这要归功于专家混合模型,尽管它们拥有强大的推理能力,但仍然可以在任何老掉牙的硬件上流畅运行。在传统的大型语言模型上,要将它们加载到显存受限的GPU上,唯一的方法是使用--ngl标志将整个层转移到系统内存中,这会导致一旦开始输入提示词,速度就会变得极其缓慢。相比之下,MoE模型允许你通过--n-cpu-moe将重量级专家卸到CPU和内存上,但你仍然可以在显卡上运行注意力层。只要你的RAM和VRAM总和能够容纳MoE模型所需的数百亿参数,那就妥了。

事实上,我就是这么干的——在仅有一块GTX 1080(8GB显存 + 24GB系统内存)上自行托管Gemma4-26B-A4B,以及在RTX 3080 Ti(12GB显存 + 32GB系统RAM)上运行Qwen3.6-35B-A3B。即使采用了这种变通方法,我的生成速度也不会低于14t/s,考虑到我很久没有升级这些系统,这表现已经相当给力了。至于这些LLM的计算能力,应付日常任务绰绰有余。

本地大语言模型与编码应用配合得天衣无缝

本地大语言模型与编码应用配合得天衣无缝

就连 Claude Code 也支持本地模型

就连 Claude Code 也支持本地模型

先从最常用到 AI 工具的地方说起吧,参数多的大模型居然能轻松搞定我的编码需求。事实上,我敢打包票,Qwen3.6-35B-A3B 跟那些付费云模型比,一点不落下风——生成代码、自动补全整段代码、扫代码块找漏洞、还能搞定那些莫名其妙的终端报错。我已经配置了 llama-vscode,把 llama-server 实例跟 VS Code 配对,这搭配起来,跟我平时写代码的活儿特别合拍。

Claude Code 这玩意儿超强,还支持本地大模型后端,我就把我的模型接上了 Qwen3.6-35B-A3B。跟你说,没啥比使唤这个巨无霸大模型更爽的了,不管是重构烂代码,还是按正确缩进重写函数,还不用担心限速,或者被 Claude Code 收高额的 API 使用费。

它们是自托管工具的得力助手

它们是自托管工具的得力助手

我打造了一套以本地模型为中心的 FOSS 生产力工具组合

我打造了一套以本地模型为中心的 FOSS 生产力工具组合

除了写代码,LLM 对我的 FOSS 工具库来说同样不可或缺。比如,我把跑着 Gemma4-26B-A4B 的 llama-server 接上了我的笔记软件 Blinko,这 LLM 在查笔记、做总结、打标签方面特别给力。同样,我的 Gemma4 和 MiniCPM-V 模型用 Paperless-GPT 来给文档做 OCR 分析,效果也超棒。这套配置对 Paperless AI 也一样好用,它不光能给我的文档自动填上正确的联系人、标签、日期这些信息,还能帮我用 RAG 来查大文件。

还有 Karakeep,它的自动摘要功能能处理 PDF、YouTube 视频,还有我存进这个书签管理器里的几乎所有链接。我还没提 AI 工具里的瑞士军刀——Open WebUI 呢。表面上看,它就是个聊天界面,但一翻设置就会发现,它啥都能干:既能接上 SearXNG 当强力 AI 搜索引擎,也能配 ComfyUI 模型当图像生成器。更厉害的是,它还支持 MCP 服务器,所以我靠它来控制那些不直接支持 LLM 的应用。说到这儿……

MCP服务器能把它们强大的推理能力用到不支持的应用程序

如果你还没听说过它们,模型上下文协议(MCP)服务器是把其他应用里的特定工具和文件开放给LLM客户端的桥梁,它们对那些自己没啥AI功能的平台特别有用。比如,我有一个TrueNAS实例连到我电脑上跑的MCP服务器,在禁用任何能在NAS上写数据的工具后,我就能给我的LLM发几句简单的话,让它们马上回我。Nextcloud也一样,我常用的那个MCP服务器还能调用日历、新闻和办公应用,把我个人云管得妥妥的。

本地LLM不只是用来当聊天机器人

我花了好几个小时给我的FOSS模型调LLM管道,得承认本地AI工具比乍一看有用多了。像我心爱的Qwen3.6-35B-A3B这样的大模型,我扔给它们的每项任务都干得特别棒,而且在我那台老机器上跑得还挺快。再塞几个容器化服务,那些不直接支持我llama-server的,就给它配上MCP服务器,我这套本地LLM管道就够用了,日常干活儿根本不用上云。