大模型量化翘楚 Unsloth 出原生桌面客户端了,macOS、Linux、Windows 三端齐发
Unsloth 是本号常客,几乎每个开源模型发布之后都有它的身影,T+1 就能拿出不同精度的量化版本。今晚,大家可以猜猜多久可以看到 Unsloth 放出的 GGUF
今年 3 月我写过它的 Studio,5 月写过它的 API:
那时候它的形态是浏览器里的 web UI,命令行敲一条装完,开 127.0.0.1:8888 用
Desktop 是把 Studio 包成了原生窗口,功能上更加完善、强大
我感觉,这次真正值得关注的地方,在于它把「本地模型」和「Agent 工具链」这两件事缝到了一起,加配本地部署的 Qwen3.8-27B,就能得到一个完全免费,离线运行、 安全可控的 Harness
Unsloth Desktop 是什么
一句话:免费、开源的本地模型客户端,跑模型和训练模型都在里面
三平台全给 :Windows
.exe、macOS.dmg、Linux 有 deb / AppImage / ARM64模型类型 :LLM、扩散图像/视频、MLX、GGUF、音频模型都能跑,也都能训
硬件 :NVIDIA、AMD、Intel、Mac 的 GPU 和 CPU 都支持,多卡自动识别,纯 CPU 也能聊天
许可 :双许可结构,核心包 Apache 2.0,Studio UI 部分是 AGPL-3.0
隐私 :官方明确说无遥测,只采集 GPU 型号和设备类型用于兼容性判断,可以完全离线运行
Unsloth 现在实际是三个东西,我列个表:
形态
是什么
适合谁
Unsloth Desktop
原生桌面 App,双击安装
不想碰命令行的人,官方推荐从这里开始
Unsloth Studio
浏览器里的 web UI,命令行装
服务器、Colab、远程机器
Unsloth Core
pip 装的 Python 包
写代码微调的人
unsetunset安装unsetunset
Desktop 从官网或 GitHub Releases 下对应平台的包,安装就是双击的事儿
不过它要后台安装整套的 Unsloth Studio 这一步有点慢
模型中心有很多本地部署可用的模型,这块是 Unsloth 最有优势的地方,Dynamic GGUF 本来就是它家的东西,别人的客户端是去 HF 拉别人的量化版,它自己就是量化版的生产方
搜索、下载、切换都在一个界面里,还能自动检测你的电脑是否满足部署条件
也可以接入第三方模型,比如我配上了 DeepSeek
再回到主界面就可以直接调用了,本地和云端模型共用同一个聊天界面,云端这边还带 prompt caching,多轮下来省不少 token
功能设计上,感觉比之前 Studio 细节多了很多
图像、视频、音频的生成和训练都考虑到了
训练也都是 0 代码
再介绍几个我觉得比较亮眼的设计吧,很多其实都是底层实现,前端感受不到
官方给的数字:工具调用准确率提升 50%,各模型区间是 30% 到 80% 更准,格式坏掉的 tool call 会被自动修复重试,单轮允许的工具调用次数放到 25 次以上,调用终止也更可靠,减少死循环
它放了一组 unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL) 开启搜索、代码执行和思考的对比,最直观的一项是 XML 泄漏从 10/10 降到 0/10
本地跑 4B、9B 这个量级的模型,模型聪不聪明其实排在后面,真正卡住人的是它 tool call 格式吐错,整条链当场断掉,前面思考得再好也白搭。这个能力补上,本地小模型才从「能聊天」跨到「能干活」
代码执行也是真沙箱,Bash 和 Python 都能跑,模型可以自己写脚本、跑出结果、验证答案,Claude Artifacts 那类程序也在沙箱里。MCP 也能接,本地模型可以调你自己那套工具
普通搜索是模型思考过程中顺手查,Deep Research 是完整流程:先出计划(你可以先审再改),再去搜、读、整理,最后产出带完整引用的报告
有两个设计蛮不错:
写报告之前它会自查一遍 没有依据的断言、前后矛盾、还没填上的空白 ,没有直接证据支撑的建议会被标成「可验证推断」,跟事实分开摆
搜索走 DuckDuckGo 的私有 API, 真的进页面抓正文 ,不只读搜索结果摘要
想更狠一点,可以设 UNSLOTH_RESEARCH_AUTO_SCRAPE=1 打开全页 grounding,把 top 结果整页读进临时 RAG 再合成,默认关着,因为费时间也吃上下文
多个对话现在可以同时生成,一边等报告一边聊别的,互不挡着
三、unsloth start:一行命令把本地模型接进 Claude Code
这个是较早之前就有的功能了,安装客户端的时候,自动就把 unsloth 命令行工具装好了
启动 Unsloth、加载模型、进项目目录,然后:
unsloth start claude
claude 换成别的就是别的 Agent:
Agent
命令
Claude Code
unsloth start claude
OpenAI Codex
unsloth start codex
Hermes Agent
unsloth start hermes
OpenClaw
unsloth start openclaw
OpenCode
unsloth start opencode
Pi Coding Agent
unsloth start pi
端点、API key、provider、模型、上下文长度这五样它自动配好,而且用的是临时或会话级注入,不会往你 Agent 的正式配置文件里塞东西,这个设计很克制,谁都不想为了试一下本地模型就让工具的全局配置被改乱
还能指定模型和量化版本,:UD-Q4_K_XL 这个后缀就是选 GGUF 量化档,本机没启 Unsloth 时它会拉一个临时 server,Agent 退出就自动关掉
我个人最喜欢的是 --as-subagent:
unsloth start claude --as-subagent --model unsloth/model-GGUF:quant
Claude Code、Codex、Pi 保持自己的主力云端模型不变,只把本地模型挂成 subagent 去干脏活累活。批量读文件、跑格式化、整理日志这类不需要智商但很烧 token 的任务交给本地模型,主力模型的额度留给真正需要脑子的地方,这个组合拳比「全用本地模型」现实得多
配套的 API 面板长这样,设置里建 token,OpenAI 兼容和 Anthropic 兼容两套格式都支持:
这条路上有几个坑,官方文档里写了,我给挑出来:
Claude Code 自带一条减速带 :它往系统提示最前面插一行每次都变的 attribution header,KV cache 每轮全部失效,本地模型直接慢 90%。启动时加
--settings '{"env":{"CLAUDE_CODE_ATTRIBUTION_HEADER":"0"}}',或者写进~/.claude/settings.jsonCodex 目前必须用 GGUF 走
llama-server后端 ,transformers 后端它不认Codex、OpenClaw、Hermes、Pi 这四个的托管目录默认是临时的,想续会话,**第一次启动就得加
--persist**,后面每次也要加,再配 Agent 自己的 resume 参数--yolo映射到各 Agent 的免确认模式,Agent 可以不问就执行命令,只在你能接受这个后果的环境用
unsloth studio --secure
这算是一个骚操作
一条命令开一个免费 Cloudflare 隧道,拿到一个公网 https://*.trycloudflare*com 地址,手机上就能看模型、看训练进度
关键在于它的默认姿态:进程仍然只绑 127.0.0.1,只通过隧道对外,隧道起不来就直接不启动(官方叫 fail closed),裸端口一次都不会露出去。对比之前那种 -H 0.0.0.0 直接把裸端口开在所有网卡上,安全性完全是两回事
这里必须把风险讲清楚,官方文档自己也写了:服务端工具(联网搜索、Python、终端代码执行)默认是开着的,而且以你的用户身份运行。谁拿到链接和 API key,谁就能在你这台机器上执行代码。对外暴露的时候,请加 --disable-tools,API key 千万别贴到截图和日志里
还有个实用细节:Cloudflare 快速隧道不支持 SSE,走隧道调 API 得把 stream 设成 false
这算是 Unsloth 的老本行:500+ 模型,2 倍速度,省 70% 显存,无精度损失,LoRA、QLoRA、全参微调、预训练、RL、GRPO、DPO、FP8、DoRA 全套都在,多 GPU 自动生效。文本、视觉、TTS 音频、embedding 模型都能训
Unsloth 把整套能力放到了客户端上
数据集不用自己攒,扔 PDF、CSV、JSON、DOCX、TXT 进去就行:
Data Recipes 的官方配方:从答案反推指令、PDF 文档问答、OCR 抽取、文本转 Python,标了难度等级
Data Recipes 是图节点式的工作流,底层用的是 NVIDIA NeMo 的 Data Designer。「PDF Document QA」这个配方对企业场景挺实用,一堆非结构化 PDF 直接转成有出处的问答训练对
训起来之后有完整的监控面板:
训练监控:step 27/30、loss 1.1352、grad norm 0.041,右侧 GPU 利用率和显存占用实时刷,下面是 loss 和梯度范数曲线
loss、梯度范数、GPU 利用率、显存实时曲线,还能在手机上看进度,配合上面的 --secure,出门在外也能盯着自己那台机器在跑什么
训完导出给 safetensors、GGUF、NVFP4、FP8,直接进 llama.cpp、vLLM、Ollama、LM Studio。训练历史会存着,随时回去重导
Mac 用户也不用担心:训练、MLX 推理、GGUF 推理在 macOS 上全都支持,这在同类工具里不多见
几个已知局限
还是 Beta ,v0.1.70-beta,图省事可以,别往生产环境放
推理有时候会更慢 ,官方在 FAQ 里直接承认:联网搜索、代码执行、tool call 自愈这三样都吃时间,全关掉之后速度才等于普通 llama.cpp 应用。如果你只要纯推理速度,这些功能记得关
纯 CPU 目前只支持聊天和 Data Recipes ,训练还是得 NVIDIA、AMD 或者 Mac
Vulkan 只加速 GGUF 推理 ,训练仍然需要 PyTorch 或 MLX 后端,别指望 Intel 核显能训模型
老硬件官方明说可能支持不好 ,太旧的卡先别抱期望
Deep Research 目前 只支持本地模型 ,每个对话同时只能跑一个
Unsloth 从一个加速微调的 Python 库,到浏览器里的 web UI,再到今天的原生桌面客户端。它一直在做的一件事,是把「本地跑大模型」从工程师的手艺变成普通人的按钮
具体到该不该装,我的建议:
Windows 用户,想在本地跑模型,又不想碰命令行 :直接下 exe,这是目前门槛最低的一条路,没有理由再等
已经在用 LM Studio 或 Ollama 的 :值得迁过来的理由在 tool call 自愈、能直接训练、Data Recipes 这三样,纯推理速度它没有优势,官方自己都承认开了功能会变慢。迁移成本也低,你在 HF 缓存和 LM Studio 里下过的 GGUF 它自己就认出来了,不用重下
想在 Claude Code、Codex 里省 token 的 :直接从
unsloth start claude --as-subagent开始,本地模型当 subagent 干脏活,这是我看到的收益最实在的用法要微调但不想写代码的 :五步向导 + Data Recipes + 导出 GGUF 这条链是闭环的,目前本地方案里完整度最高
从哪一步开始?装完先只干一件事:下一个 20GB 以内的模型,把 unsloth start 接到你平时用的那个 Agent 上,跑一个真实的小任务,面对这类客户端,别看它宣传了几十个功能,就看一件事:它能不能接住你手上那个真实任务
目前我内网跑的还是 OpenWebUI,也在想要不要上个 Unsloth DeskTop 呢?
既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见
热门跟贴