如果你刚好 需要安装个能力过得去的本地模型,来做隐私要求高的工作。
又刚好 在用性能不错的电脑,例如一台内存达到32G的mac。
还刚好 在用WorkBuddy。
那么WorkBuddy内置的本地模型值得一试。
打开网易新闻 查看精彩图片
在「设置」—「模型」里面,可以看到模型列表下增加了一个「本地模型」,一键下载即可在WorkBuddy使用,不需要通过ollama或者llama.cpp之类的来承载。
这个Qwen3.6 35B-3AB是个MoE模型,35B参数只激活3B参数,提升本地的推理速度。同时,腾讯对模型进行了裁剪优化,大小只有15GB,比ollama上面的24GB版本少了1/3,这让它在WorkBuddy里面使用更加顺畅。
打开网易新闻 查看精彩图片
实测模型速度观感还可以,生成速度稳定在 30–35 token/s ,运行时候占用内存大概17G。首字延迟会比较高,主要是 WorkBuddy系统提示和工具列表加载等很大(一般能够达到几万token),关闭掉不常用的工具可以改善。
和云端比,它当然没那么快、上下文也不如线上模型稳;但作为本机、不出网、零按量计费的方案,这个速度已经能日常用了,性价比极高。
打开网易新闻 查看精彩图片
热门跟贴