9月30日,YC S25 批次的 Magnitude 团队把自研推理引擎完整开源:不换模型、不换硬件,同一个开源模型在你自己的电脑上最快能比 llama.cpp 快一倍,Apache 2.0 协议,零 token 费用。

一、发生了什么:开源一天,5700 颗星

9月30日,YC S25 批次初创团队 Magnitude 在 Hacker News 上发布 v0.2.0:一个用 Rust 写的本地推理引擎,专门给 AI 编程智能体(Codex、Claude Code、Cline 这类)当「本地发动机」。开源不到一天,GitHub 星标冲过 5700,登上 HN 首页。

它解决的问题很具体:开源模型的能力已经够用,但想跑在自己电脑上,速度总差一口气。llama.cpp、Ollama、LM Studio 这些主流引擎,出厂时内核是为「一类硬件」预编译好的——你的那块具体芯片,总有性能被白白浪费掉。

打开网易新闻 查看精彩图片

二、为什么快:内核在你机器上「现场编译」

Magnitude 的思路来自编译器领域的老办法——按设备调优。模型运行前,引擎先在你的设备上现场编译、实测多组计算内核参数,挑出对这块芯片最快的实现。权重一份不改,速度直接受益。

官方给出的对比数据(Qwen 3.6 35B-A3B,4-bit 量化,64K 上下文,关闭投机解码):

• Mac M4 Pro 48GB(Metal):解码从 30 tok/s 提到 57 tok/s,快 92%,接近翻倍;预处理 466→507 tok/s,快 9%

• 英伟达 DGX Spark(CUDA):解码 49→58 tok/s,快 19%;预处理 2033→2507 tok/s,快 23%

打开网易新闻 查看精彩图片

简单说,苹果芯片用户收益最大,N 卡用户也有约两成提升。要提醒的是,这些数字全部来自官方自测,尚无第三方复现,但方向已经足够诱人。

三、不只是快:省显存、抗并发、数据不出门

• 内存弹性伸缩:只为模型权重常驻保留内存,会话结束即释放,官方实测每个智能体省 27% 内存

• 并发不打架:多个智能体同时干活时共享前缀缓存,开第二个窗口不会把速度腰斩

• 自带投机解码:DFlash、DSpark、DFlash2 草稿模型开箱即用,速度还能再往上叠

• 隐私天然达标:模型下载完即可全程断网使用,提示词、文件、输出都不离开本机

打开网易新闻 查看精彩图片

一键接入 Codex、Claude Code、Cline 等主流编程智能体

四、8GB 显存能跑什么?官方目录直接查

Magnitude 内置了 15 个模型的目录,覆盖 Qwen、Gemma、Meta、NVIDIA、OpenBMB 等主流开源家族,每个模型按 Q4—Q8 不同量化档标好体积,并给出「智能指数」——即相对当前最强模型的智力百分比。装好后它会先给你的机器做体检,下载之前就告诉你这块显卡大概能跑出多少 token 每秒。

打开网易新闻 查看精彩图片

档位

代表模型(Q4 体积)

参考硬件

能干什么

2GB 级

MiniCPM5 2B(2.2GB)

几乎任何电脑

随手问答、工具调用

8GB 档

Gemma 4 E4B(5.2GB)、Qwen3.5 9B(7.1GB)

16GB 内存笔记本

日常写作、摘要、补全

16GB 档

Gemma 4 12B QAT(6.9GB)、Gemma 4 26B-A4B(15.4GB)

RTX 4060 Ti 16GB

复杂推理、智能体任务

24GB 档

Muse Glimmer 30B(19.6GB)、Qwen3.8 27B(20.5GB)

RTX 3090 / 4090

接近旗舰的多模态与编程

Mac 大内存

Nemotron 3.5 Lightning 30B(23.6GB,1M 上下文)

Mac 48GB 统一内存

长文档、仓库级分析

五、三步上手,老机器也能试

• 第一步:到 magnitude.dev 下载桌面版,支持 Windows、macOS、Linux,装完自带命令行

• 第二步:在 Discover 里挑一个推荐模型下载,软件按你的硬件自动匹配量化档位

• 第三步:在 Connections 里一键接入你正在用的智能体(Codex、Claude Code、Cline、OpenCode 等),或者对接本地 10100 端口的 OpenAI 兼容 API

不想开窗口的,命令行 magnitude serve 可以无界面常驻;magnitude hardware 和 magnitude catalog recommendations 两条命令,就能查硬件评估和适配清单。

打开网易新闻 查看精彩图片

本地模型直接驱动编程智能体干活

六、冷思考:三个别急着迷信的地方

• 数字是官方自测:测试环境由项目方掌控,「最快 2 倍」取的是 Metal 最好成绩,N 卡上 19% 的提升要冷静看

• 本地不会让模型变聪明:引擎提速不改变能力上限,27B 模型再快也是 27B

• 生态还在早期:llama.cpp 和 Ollama 背后是多年积累的社区,格式兼容性仍是最稳妥的兜底

务实的用法是双轨制:日常私密、高频、重复性任务交给本地模型——边际成本为零;需要最强能力的硬任务再上云端。对天天开着编程智能体的人来说,本地这一侧从「能用」到「好用」的临界点,可能就由这类引擎推开。

同期值得关注

• 谷歌发布 Gemini 4 Argon:1M 上下文、定价每百万 token 输入 2 美元/输出 10 美元,目前仅向受邀的网络安全防御者开放;官方透露其智能体已把 Fuchsia 内核 80 多万行 C/C++ 迁到 Rust

• 英伟达重打包 Qwen3.8-Flash-Next NVFP4 版:125B MoE 压到约 135GB,单台 128GB 统一内存的 DGX Spark 即可运行

• OpenAI 披露阻断大规模「推理提取」:涉案账户超 1.5 万,点名部分活动与月之暗面(Moonshot AI)关联个人有关

• 社区剪枝版 Victoria 开源:把 Qwen3.8-Flash-Next 的专家砍掉 44%,GGUF Q4 版约 49GB,编码能力仅小幅下降