很多人听说DeepSeek开源、Qwen开源了,想下载下来免费用一下。但第一次下载本地大模型,会遇到一个很奇怪的问题:下了一个AI大模型文件,双击打不开。因为模型文件本身,只是训练好的参数数据。说白了就是 AI 的“大脑”,它没有界面,也不会自己运行。还需要一个工具,把这颗大脑装进去、让它运行起来,Llama.cpp 就是干这个的,本文就详细介绍下llama.cpp这个工具,适合零基础纯小白

Llama.cpp 是什么?

简单来说,就是一个“模型运行工具”,专业一点叫“推理引擎”,它用C/C++写成,用尽量少的依赖,让AI大模型,能在尽可能多的硬件上跑起来。

Llama.cpp在本地部署软件中,是非常热门的选择。优点是

  • 硬件兼容范围广:老 CPU、NVIDIA 显卡、AMD 显卡、Intel 核显、Mac 的苹果芯片,它都有对于的版本。
  • 参数非常细,自由度高:CPU 用几条线程、模型多少层交给显卡、上下文开多长,都可以自己控制。

缺点是它需要命令行操作(对小白来说算缺点吧),第一次看着一串参数,还是会有点懵。笔者个人认为,小白用户直接用LM Studio或Ollama更省事,但只要你想把现有硬件性能榨干,那Llama.cpp还是非常值得研究下的。

Llama.cpp、Ollama、LM Studio,到底该用哪个?

这三个工具经常一起出现,下面是对比表格

工具

你可以理解成

操作难度

最适合谁

Llama.cpp

底层推理引擎

中高

想调参数、跑 GGUF、搭本地 API 的进阶用户

Ollama

自动化

程度更高的模型运行工具

想一行命令下载并聊天的大多数用户

LM Studio

带图形界面的本地模型软件

不想碰命令行的纯小白

三者的使用需求完全不同。

1、只是想在电脑上和本地聊天,用LM Studio就行,图像界面,点点鼠标就可以了。

2、要给Agent提供本地接口,Ollama 的体验很省心。

3、喜欢折腾,想榨干硬件性能,选Llama.cpp。

如何用Llama.cpp部署本地AI模型?(一共三步)

  1. 下载Llama.cpp
  2. 下载模型
  3. 启动模型

下面直接上手,部署一个20亿参数小模型,练一下手,跑一下流程。(更大的模型,也是一样的方法。)

第一步:下载 Llama.cpp

下载网址:https://github.com/ggml-org/llama.cpp/releases,下载自己电脑对应的预编译包。这里以Windows系统为例,我的显卡是N卡,我下载图中圈出来的两个文件。

打开网易新闻 查看精彩图片

纯CPU用户选Windows的CPU版本;N卡用户选带CUDA的Windows版本。我的显卡是N卡,我下载图中圈出来的两个文件。下载后,把两个文件解压到电脑桌面,文件重命名为llama.cpp。

第二步:下载模型

到模型发布平台,Hugging Face上,网址:https://huggingface.co/models,找到自己要下载的模型,这里以Qwen3.5-2B的去审查版本为例,一般选择Q4-K-M.guff结尾的文件,点击下载。

打开网易新闻 查看精彩图片

下载后,把模型文件,复制粘贴到前面下载好的llama.cpp文件夹中,的models文件夹下。

打开网易新闻 查看精彩图片

这样之后,模型就下载完了,运行模型的工具,第一步也下载完了,基本大功告成。

第三步:让Llama.cpp启动运行模型

只有这一步,才需要命令行,不过也相对简单。就是1、打开系统自带的命令行工具Power Shell,2、用命令进入到Llama.cpp文件夹,然后再用命令启动模型。

1、先打开Windows PowerShell

打开网易新闻 查看精彩图片

2、进入Llama.cpp文件夹,在PowerShell中,输入命令,按键盘Enter键。

cd C:\Users\45469\Desktop\llama.cpp

,这个命令的含义是,让电脑进入到Llama.cpp文件夹。

这里说一下,我的电脑名称是45469,每个人的电脑名不一样,所以这里,每个人的命令也不一样。总之就是cd后面加Llama.cpp文件夹所在位置。

打开网易新闻 查看精彩图片

如何查看你电脑Llama.cpp文件位置路径?

点击文件夹最上面,就能显示文件具体路径位置。

打开网易新闻 查看精彩图片

3、在PowerShell中继续输入,模型启动命令,按键盘Enter键。

打开网易新闻 查看精彩图片

命令具体内容是:

.\llama-server.exe -m models\Qwen3.5-2B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf -ngl 35 -c 4096

命令执行后的效果:

打开网易新闻 查看精彩图片

出现这样的内容,就成功了,然后在浏览器中打开地址:

http://127.0.0.1:8080

就可以看到网页聊天界面了。

打开网易新闻 查看精彩图片

命令行中的字母参数都是啥意思?主要就 3 个

.\llama-server.exe-mmodels\Qwen3.5-2B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf-ngl35-c4096

参数

作用

建议

-m

指定本地GGUF模型路径

路径有空格时加英文双引号

-ngl

卸载到GPU的层数

有独显先用-ngl 99测试

-c

上下文长度

日常从4096或8192开始

命令整体的意思是:启动llama服务器程序(.\llama-server.exe),运行具体模型(-mmodels\Qwen3.5-2B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf),卸载35层到显卡GPU(-ngl35),上下文长度是4096(-c4096)

最常见的几个坑

第一,文件格式不对。 下载前先看清是不是GGUF。必须是.gguf后缀的模型才行。

第二,模型能下载,不等于电脑能跑。硬盘只负责存模型;真正运行看内存和显存。模型文件 8GB,不代表 8GB 内存就稳,系统、上下文和运行时本身都要占空间。

第三,显卡没加速。确认下载的是CUDA/ Vulkan等对应后端的版本,再看是否加了 -ngl 99。很多人装完直接运行 CPU 版,然后发现显卡没干活。

最后

Llama.cpp算是本地部署的进阶工具,参数设置的自由度高了很多,且因为是C语音写的,对硬件性能的使用更加极致,缺点就是需要用命令行,不过并不是真的写代码,就是简单启动命令,也不算难,另外现在有了AI,不懂就问AI,或者让智能体(Agent)直接操作。

然后具体选择哪个模型运行工具,还是要看使用需求的,单纯想和 AI 聊天,LM Studio或Ollama更简单一点;准备深入研究本地部署、性能调优,还有对Agent提供API接口服务,Llama.cpp还是很值的学习一下的。Agent接上了本地模型的API,就相当于有了无限免费Token了。

以上,希望对你有帮助。

如果想了解更多AI大模型本地部署,可以关注我,我会分享各种模型的部署方法和教程

有问题评论区见。