很多人听说DeepSeek开源、Qwen开源了,想下载下来免费用一下。但第一次下载本地大模型,会遇到一个很奇怪的问题:下了一个AI大模型文件,双击打不开。因为模型文件本身,只是训练好的参数数据。说白了就是 AI 的“大脑”,它没有界面,也不会自己运行。还需要一个工具,把这颗大脑装进去、让它运行起来,Llama.cpp 就是干这个的,本文就详细介绍下llama.cpp这个工具,适合零基础纯小白。
Llama.cpp 是什么?
简单来说,就是一个“模型运行工具”,专业一点叫“推理引擎”,它用C/C++写成,用尽量少的依赖,让AI大模型,能在尽可能多的硬件上跑起来。
Llama.cpp在本地部署软件中,是非常热门的选择。优点是:
- 硬件兼容范围广:老 CPU、NVIDIA 显卡、AMD 显卡、Intel 核显、Mac 的苹果芯片,它都有对于的版本。
- 参数非常细,自由度高:CPU 用几条线程、模型多少层交给显卡、上下文开多长,都可以自己控制。
缺点是它需要命令行操作(对小白来说算缺点吧),第一次看着一串参数,还是会有点懵。笔者个人认为,小白用户直接用LM Studio或Ollama更省事,但只要你想把现有硬件性能榨干,那Llama.cpp还是非常值得研究下的。
Llama.cpp、Ollama、LM Studio,到底该用哪个?
这三个工具经常一起出现,下面是对比表格
工具
你可以理解成
操作难度
最适合谁
Llama.cpp
底层推理引擎
中高
想调参数、跑 GGUF、搭本地 API 的进阶用户
Ollama
自动化
程度更高的模型运行工具
想一行命令下载并聊天的大多数用户
LM Studio
带图形界面的本地模型软件
不想碰命令行的纯小白
三者的使用需求完全不同。
1、只是想在电脑上和本地聊天,用LM Studio就行,图像界面,点点鼠标就可以了。
2、要给Agent提供本地接口,Ollama 的体验很省心。
3、喜欢折腾,想榨干硬件性能,选Llama.cpp。
如何用Llama.cpp部署本地AI模型?(一共三步)
- 下载Llama.cpp
- 下载模型
- 启动模型
下面直接上手,部署一个20亿参数小模型,练一下手,跑一下流程。(更大的模型,也是一样的方法。)
第一步:下载 Llama.cpp
下载网址:https://github.com/ggml-org/llama.cpp/releases,下载自己电脑对应的预编译包。这里以Windows系统为例,我的显卡是N卡,我下载图中圈出来的两个文件。
纯CPU用户选Windows的CPU版本;N卡用户选带CUDA的Windows版本。我的显卡是N卡,我下载图中圈出来的两个文件。下载后,把两个文件解压到电脑桌面,文件重命名为llama.cpp。
第二步:下载模型
到模型发布平台,Hugging Face上,网址:https://huggingface.co/models,找到自己要下载的模型,这里以Qwen3.5-2B的去审查版本为例,一般选择Q4-K-M.guff结尾的文件,点击下载。
下载后,把模型文件,复制粘贴到前面下载好的llama.cpp文件夹中,的models文件夹下。
这样之后,模型就下载完了,运行模型的工具,第一步也下载完了,基本大功告成。
第三步:让Llama.cpp启动运行模型
只有这一步,才需要命令行,不过也相对简单。就是1、打开系统自带的命令行工具Power Shell,2、用命令进入到Llama.cpp文件夹,然后再用命令启动模型。
1、先打开Windows PowerShell
2、进入Llama.cpp文件夹,在PowerShell中,输入命令,按键盘Enter键。
cd C:\Users\45469\Desktop\llama.cpp,这个命令的含义是,让电脑进入到Llama.cpp文件夹。
这里说一下,我的电脑名称是45469,每个人的电脑名不一样,所以这里,每个人的命令也不一样。总之就是cd后面加Llama.cpp文件夹所在位置。
如何查看你电脑Llama.cpp文件位置路径?
点击文件夹最上面,就能显示文件具体路径位置。
3、在PowerShell中继续输入,模型启动命令,按键盘Enter键。
命令具体内容是:
.\llama-server.exe -m models\Qwen3.5-2B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf -ngl 35 -c 4096命令执行后的效果:
出现这样的内容,就成功了,然后在浏览器中打开地址:
http://127.0.0.1:8080就可以看到网页聊天界面了。
命令行中的字母参数都是啥意思?主要就 3 个
.\llama-server.exe-mmodels\Qwen3.5-2B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf-ngl35-c4096
参数
作用
建议
-m
指定本地GGUF模型路径
路径有空格时加英文双引号
-ngl
卸载到GPU的层数
有独显先用-ngl 99测试
-c
上下文长度
日常从4096或8192开始
命令整体的意思是:启动llama服务器程序(.\llama-server.exe),运行具体模型(-mmodels\Qwen3.5-2B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf),卸载35层到显卡GPU(-ngl35),上下文长度是4096(-c4096)
最常见的几个坑
第一,文件格式不对。 下载前先看清是不是GGUF。必须是.gguf后缀的模型才行。
第二,模型能下载,不等于电脑能跑。硬盘只负责存模型;真正运行看内存和显存。模型文件 8GB,不代表 8GB 内存就稳,系统、上下文和运行时本身都要占空间。
第三,显卡没加速。确认下载的是CUDA/ Vulkan等对应后端的版本,再看是否加了 -ngl 99。很多人装完直接运行 CPU 版,然后发现显卡没干活。
最后
Llama.cpp算是本地部署的进阶工具,参数设置的自由度高了很多,且因为是C语音写的,对硬件性能的使用更加极致,缺点就是需要用命令行,不过并不是真的写代码,就是简单启动命令,也不算难,另外现在有了AI,不懂就问AI,或者让智能体(Agent)直接操作。
然后具体选择哪个模型运行工具,还是要看使用需求的,单纯想和 AI 聊天,LM Studio或Ollama更简单一点;准备深入研究本地部署、性能调优,还有对Agent提供API接口服务,Llama.cpp还是很值的学习一下的。Agent接上了本地模型的API,就相当于有了无限免费Token了。
以上,希望对你有帮助。
如果想了解更多AI大模型本地部署,可以关注我,我会分享各种模型的部署方法和教程。
有问题评论区见。
热门跟贴