一开始我也怀疑,本地跑大模型能有什么出息。结果最近试下来,推理能力确实上来了,旧设备也能扛住正经生产力任务。

老显卡也能跑新模型

打开网易新闻 查看精彩图片

我手头还是Pascal时代的老卡,按说早该淘汰。但新的混合专家模型对硬件友好得多,稍微调一下,token生成速度完全能看。

像Qwen3.6-35B-A3B和Gemma-4-26B-A4B这类模型,本地部署后直接替换云端版本,我的自由开源软件栈照常运转。

本地化替代没想象中难

关键就两点:模型选对,参数调好。剩下的交给时间,旧手机服务器这件事,比预期靠谱。