UC Berkeley 近日开源了推理引擎 FreeToken,让大模型本地部署的门槛又降了一截。官方数据显示,单张 RTX PRO 6000 显卡即可运行 753B 参数的 GLM-5.2,生成速度达到 14.9 tok/s;而在显存仅 8GB 的 RTX 4060 笔记本上,也能流畅运行 Qwen3.6-35B,速度可达 39.3 tok/s

这一性能表现的关键在于,FreeToken 在消费级 GPU 上比常见的 Ollama 方案快 2-4 倍。更重要的是,它不需要依赖极端的量化压缩手段,就能用官方权重直接运行前沿模型,这对本地部署的实用性和模型输出质量都是个不小的提升。

打开网易新闻 查看精彩图片

本地推理的体验差异

对于开发者而言,速度翻倍意味着本地调试和原型验证的效率提升。过去需要多卡或云端集群才能跑动的模型,如今在单张专业卡甚至笔记本上就能完成推理,这直接改变了硬件选型和部署策略。

FreeToken 的开源,让更多研究者和工程师有机会在本地复现前沿模型的推理效果,也为后续的推理优化提供了新的参照系。