llama.cpp 昨天在 GitHub 发了一个正式版本号 v0.3.0——这是这个开源项目 3 年来第一次走出 b10621 这种 nightly 编号,给了一个 semver 意义上的"正式版本"。除了版本号本身的变化,release notes 里列了 5 个核心改动,但本地玩家真正能用上的是 3 个。
多卡党:DeepSeek 4 加了 -sm tensor,4 卡预填充真快了
这次 v0.3.0 最硬的技术改动,是 DeepSeek 4 这个架构多了 -sm tensor 这个 split mode。翻译一下:以前 llama.cpp 在多张 GPU 上跑大模型时,只能按 layer 切——一张卡跑第 1-10 层,下一张跑第 11-20 层。瓶颈在每张卡之间来回搬运 KV cache。
-sm tensor 改成按 tensor(权重)切——同一个 attention 层里,Q/K/V 矩阵的不同行分给不同卡算。这样每张卡只要守好自己那一小块权重就行,KV cache 不用跨卡来回搬运,4 张 4090 跑 DeepSeek 这种 670B 级别模型时,预填充阶段速度比之前实测快一截。
配合 meta-backend tensor split 的 state propagation 修复,切分状态在不同后端之间能正确传递了。之前用 Vulkan + CUDA 混插的时候偶尔会出 bug,现在稳了。
Mac 党:Metal 改成按算子编译,构建时间从 30 分钟降到 5 分钟
这对 Mac 本地跑大模型的玩家是实打实的福利——以前每次 git pull && cmake --build build -j 都要去倒杯咖啡等着,现在基本上一个 build 命令下去,过几分钟就能跑新模型了。
另外 Metal Flash Attention 也按设备调优了一遍,M3 Max / M4 Max 这种高端芯片在 attention 计算上的吞吐又涨了一波,但具体幅度要看社区跑分。
单卡党:GLM-4.5-Air 的 MTP 来了,推理速度直接快 30-50%
给 GLM-4.5-Air 这个智谱的 MoE 模型加上了 MTP支持。
MTP 的原理:模型每一步同时预测下 3-5 个 token 的草稿,再用传统的 speculative decoding 校验。命中率高的话,等于用 1 次大模型推理的成本拿到 3-5 个 token 的产出,速度直接乘 3-5 倍。命中率低也不会变慢,只是回到普通推理速度。
GLM-4.5-Air 是 2026 年国产开源里最强的 MoE 之一(106B 总参数 / 12B 激活参数),加上 MTP 后在单张 4090/5090 上的吞吐直接上一个台阶。
实操:怎么升级到 v0.3.0
两条路:
升级方式
命令
适用场景
源码编译
git checkout v0.3.0 && cmake -B build && cmake --build build --config Release -j
Linux/Mac 全功能玩家
预编译包
GitHub release page 选对应平台(Windows CUDA 13 / Ubuntu x64 / macOS arm64 等 20+ 包)
想立刻跑新模型的人
升级前先备份你的模型缓存和 -ngl / --tensor-split 等启动参数——meta-backend tensor split 的 state 行为变了,老配置在新版上可能表现不同,跑分前用 llama-bench 验一下。
这版本跟之前有什么不同
llama.cpp 从 2023 年到现在,3 年累计 7000+ 个 PR、10 万+ commits,但从来没有过 semver 意义上的正式版——全是 b10621 这种 nightly build 编号。
对本地 LLM 玩家来说,v0.3.0 是个分水岭——以后你会更习惯看到 llama.cpp v0.x.x 这种正式版本号。nightly 文件名 llama-b10621-bin-win-cuda-13.3-x64.zip 会逐步让位给 llama-v0.x.x-bin-...zip 这种带 semver 的正式包。
热门跟贴