打开网易新闻 查看精彩图片

Unsloth:7.2万+ Stars的本地AI训练神器,微调快2倍显存省七成,还配了图形界面一句话定位

Unsloth 是一个面向本地 GPU 的大模型微调与运行引擎——它用自研的 OpenAI Triton 反向传播内核,把 LoRA/QLoRA 微调的速度拉到 2 倍、显存砍掉 70%;如今又补上了 Unsloth Studio 本地图形界面,让你不写代码也能跑模型、做数据、训出专属大模型。它和 [[Ollama]]、[[vLLM]]、[[AirLLM]] 一样追求"本地、免费、自主可控",但落点最硬核:别人的工具让你"把模型跑起来",Unsloth 让你"把模型改造成自己的"。

项目档案

维度

数据

仓库名

unslothai/unsloth

GitHub Stars

72,554+(今日 +572,登榜 Trending)

Forks

6,543

开源协议

Apache-2.0(可商用)

主语言

Python

创建时间

2023-11-29

最近更新

2026-08-16(高度活跃)

官方文档

unsloth.ai/docs

支持硬件

NVIDIA / AMD / Apple MLX / CPU / 多 GPU

痛点引入:想训自己的模型,为什么总卡在第一步

你遇到的坎

传统 PyTorch 微调的真相

"我有张 24G 显卡,能训 7B 吗?"

❌ 默认 autograd 显存爆满,QLoRA 也常 OOM

"想跑通一个官方示例"

❌ 环境依赖地狱,CUDA 版本对不上就报错

"微调一次要好久"

❌ 单卡几小时起,迭代成本高

"我不是程序员,能用吗?"

❌ 过去只能写 Python 脚本,门槛高

微调大模型,听起来是"大厂实验室"的专利。但过去一年,越来越多个人和小团队想拥有"自己的模型"——客服话术、写作风格、行业知识,通通想塞进底座里。可现实是:显卡不够大、时间不够用、门槛不够低。这三座大山,正是 Unsloth 要搬掉的。

核心定位:用 Triton 手写内核,把训练"榨干"

这是 Unsloth 最容易被忽略、却最关键的设计哲学:

"不靠更贵的显卡,靠更聪明的计算。"

PyTorch 的默认反向传播(autograd)为了通用性,会缓存大量中间激活值,显存和算力都被白白浪费。Unsloth 用 OpenAI Triton 手工重写了 LoRA/QLoRA 的关键反向传播内核——只算"该算的梯度",不存"不必存的激活"。结果是:同一个 7B 模型,在同样一张卡上,训练快 2 倍、显存少 70%。更妙的是,这些内核是开源社区预写好的,你不需要自己写一行 CUDA,装好 PyTorch 就能直接享受加速。对普通玩家来说,这意味着原本要租 A100 才能做的事,如今一张 RTX 4090 就能扛;对工作室来说,则意味着同样的硬件能一天多跑好几轮实验。

核心功能详解1. 全模型家族一键加速

能力

LLM 微调

Llama、Qwen、Gemma、DeepSeek、Mistral、GLM 等全系支持

扩散模型

Stable Diffusion / FLUX / DiffusionGemma 图像与视频生成

语音与嵌入

TTS(Orpheus 等)、embedding 模型微调

长上下文 RL

比其它方案长 7 倍上下文的强化学习训练

无论你想炼的是对话模型、画图模型还是语音模型,Unsloth 都能在同一套加速内核下接管,不用为每个任务换一套工具链。

2. 量化级性能提升

官方实测(部分摘录):

模型

提速

省显存

Llama 3.1 8B(Alpaca)

70%

gpt-oss 20B

70%(GRPO 80%)

MoE LLM

12×

35%

RoPE/MLP 新内核

30%

注意 MoE(混合专家)模型那一行:12 倍提速意味着原本跑不动的巨型稀疏模型,现在消费级显卡也能啃下来。

3. Unsloth Studio:本地图形界面(Beta)

这是 2026 年最大的变化——Unsloth 不再只是个 Python 库,而是带上了Studio 本地 UI。它支持 Windows / Linux / WSL / macOS,内置 Chat、数据配方(Data Recipes)、训练、部署、MCP 连接等模块,还能在设置里切换 GGUF 推理后端。其中的 MCP 与 Connections 模块,意味着它能直接接入你的 AI 编码助手与 Agent 工作流,把"训好的模型"变成"随手可调用的能力"。不懂代码的人,也能在界面里上传数据、点几下就把模型训出来,真正把"本地炼模型"的门槛打到了地板。

与同类方案对比

维度

Unsloth

[[Ollama]]

[[vLLM]]

[[AirLLM]]

核心定位

本地训练+运行

本地推理

高吞吐推理服务

极小显存推理

微调能力

✅ 强(2×/70%)

❌ 仅跑

❌ 仅跑

❌ 仅跑

图形界面

✅ Studio

⚠️ 有前端

❌ API

❌ CLI

显存优化

内核级

量化

批处理

逐层卸载

简单说:[[Ollama]] / [[vLLM]] / [[AirLLM]] 让你"把模型跑起来",Unsloth 让你"把模型改造成自己的"。它和 [[needle]](端侧小模型)、[[Soup]](本地训练 CLI)共同补齐了"本地 AI 自主可控"的拼图——一个偏极简端侧,一个偏命令行精炼,而 Unsloth 偏内核级加速 + 图形化易用。

实际应用场景

  • 个人开发者:在一张消费级 24G 显卡上,把 Qwen 微调成你的私人客服 / 写作助手,成本趋近于零,模型和数据全留在本地,不用担心厂商停服或涨价。
  • 独立站长 / 小微团队:用 Studio 图形界面,无编码基础也能定制行业话术模型,免去 API 调用费与隐私外泄风险。
  • 研究人员 / 学生:长上下文 RL 训练比别家快 7 倍,跑实验的试错成本大幅下降,论文迭代更轻松。
  • 企业本地部署:Apache-2.0 协议可商用,配合自托管把敏感数据留在内网训练,合规无忧。
快速上手安装(推荐 uv,Windows / Linux / macOS 通用)

# Linux / WSLcurl -LsSf https://astral.sh/uv/install.sh | shuv venv unsloth_env --python 3.13source unsloth_env/bin/activateuv pip install unsloth --torch-backend=auto
启动本地图形界面 Studio

# 本地访问unsloth studio -p 8888# 局域网 / 云端访问(带 Cloudflare 公网隧道)unsloth studio -H 0.0.0.0 --cloudflare
Windows 若已装好 PyTorch,也可直接 pip install unsloth。
小结:本地炼模型的门槛,正在被拉平

如果说过去一年"本地跑模型"已经普及([[Ollama]] 们功不可没),那 2026 年大家开始问的下一个问题是:"我能不能本地改模型?"Unsloth 恰好卡在这个需求爆发点上——内核级加速把硬件成本压下来,Studio 又把操作门槛压下来。再加上 Apache-2.0 可商用、多后端兼容(NVIDIA/AMD/MLX/CPU),它几乎是个人和小团队迈向"模型自主"最顺手的一级台阶。今天它以单日 +572 星登榜 Trending,并非偶然。

信息汇总

项目

信息

GitHub

https://github.com/unslothai/unsloth

官网 / 文档

https://unsloth.ai/docs

许可证

Apache-2.0(可商用)

适合人群

想本地微调大模型者、独立开发者、小微团队、研究者

一句话总结

不换显卡也能把大模型训得又快又省,如今还送你一个本地图形界面。