一开始我也怀疑,本地跑大模型能有什么出息。结果最近试下来,推理能力确实上来了,旧设备也能扛住正经生产力任务。
老显卡也能跑新模型
打开网易新闻 查看精彩图片
我手头还是Pascal时代的老卡,按说早该淘汰。但新的混合专家模型对硬件友好得多,稍微调一下,token生成速度完全能看。
像Qwen3.6-35B-A3B和Gemma-4-26B-A4B这类模型,本地部署后直接替换云端版本,我的自由开源软件栈照常运转。
本地化替代没想象中难
一开始我也怀疑,本地跑大模型能有什么出息。结果最近试下来,推理能力确实上来了,旧设备也能扛住正经生产力任务。
老显卡也能跑新模型
我手头还是Pascal时代的老卡,按说早该淘汰。但新的混合专家模型对硬件友好得多,稍微调一下,token生成速度完全能看。
像Qwen3.6-35B-A3B和Gemma-4-26B-A4B这类模型,本地部署后直接替换云端版本,我的自由开源软件栈照常运转。
本地化替代没想象中难
00:00
热门跟贴