最近本地大模型这条线又冒出来一个挺有意思的项目,叫 FlashML-org/FreeToken。

如果只看项目介绍,你很容易把它当成又一个 Ollama、llama.cpp,或者一个新的本地模型启动器。但我顺着作者 Shuo Yang 的帖子、论文和项目文档研究了一圈以后,发现它真正想解决的问题,其实和大多数本地推理工具不太一样。

以前我们在本地跑大模型,最先考虑的通常都是一个问题:

我的显卡有多少显存?这个模型能不能塞进去?

FreeToken 换了个思路。

既然一个超大的 MoE 模型本来就很难完整塞进显存,那不如别硬塞了,干脆把显卡、CPU、系统内存和 PCIe 一起利用起来,让整台电脑共同完成推理。

于是作者现在展示出了几组很容易吸引眼球的数据:8GB 显存的 RTX 4060 Laptop,可以跑 Qwen3.6 35B,速度大约 39 tok/s;单张 RTX 5090,可以跑 DeepSeek-V4-Flash 284B,速度大约 22~25 tok/s;RTX PRO 6000 甚至可以跑 GLM-5.2 753B,速度大约 15 tok/s。

打开网易新闻 查看精彩图片

如果你喜欢折腾本地模型,这个项目确实值得关注一下。但它最值得看的,不只是“能跑多大模型”,而是它背后那套思路:本地推理的上限,也许真的不该只看显存了。

打开网易新闻 查看精彩图片

一、先把最大的误区说清楚:284B 并没有塞进 RTX 5090

看到“单卡 RTX 5090 跑 DeepSeek V4 284B”,很多人的第一反应一定是:32GB 显存居然能装下一个 284B 模型?

答案当然是否定的。

这里最容易被标题带偏。FreeToken 论文里测试 DeepSeek-V4-Flash 的那台机器,除了 RTX 5090 这张显卡之外,还有 192GB 的 DDR5 系统内存。也就是说,真正支撑这件事成立的,并不只是 5090 的显存,而是显卡加上一大坨系统 RAM 共同参与了推理。

这也是理解 FreeToken 的第一把钥匙。

它不是让显卡“突然变大了”,也不是让 32GB 显存 magically 装下几百 B 参数,而是换了一套问题定义方式:显存不再是模型容量的唯一边界,系统内存也被拉进了战场。

尤其是 DeepSeek-V4-Flash 这种 MoE,也就是 Mixture of Experts,混合专家模型。它虽然总参数高达 284B,但每生成一个 Token,并不会把全部参数都算一遍,而只是激活其中一部分专家。这样一来,你就会发现,真正难的不是“算不动”,而是“这么多专家权重放在哪里,什么时候调出来”。

FreeToken 本质上就是在解决这个问题。

打开网易新闻 查看精彩图片

二、FreeToken 的核心思路:显存不够,系统内存来补

FreeToken 最值得讲的一点,就是它不再把系统内存当成一个无关角色。

以前我们讨论本地大模型,经常会把注意力全部放在显卡上,仿佛电脑里只有 GPU 是干活的,CPU 和 RAM 都只是打下手。FreeToken 完全不是这个逻辑,它把整台电脑拆成了一个异构计算平台。

你可以把它简单理解成两层仓库。

第一层是 GPU 显存,这是一个高速但空间很小的仓库,里面放最常用、最值得提前缓存的 Expert。第二层是系统内存,这是一个大得多但速度慢一些的仓库,里面保存模型更完整的 Expert 权重。

模型开始工作后,Router 会判断这一轮需要调用哪些专家。如果这些专家已经在显存里,那当然最好,直接计算,速度最快。如果没有命中,FreeToken 再从系统内存这边调度。

所以 FreeToken 的本质,并不是“把超大模型完整搬到显卡上”,而是把大模型拆成了“显存缓存 + 内存仓库”的结构。

也正因为这样,8GB 显存的 4060 Laptop 才有机会跑 35B。不是因为 35B 模型突然只需要 8GB,而是因为 FreeToken 让“8GB 显存”这件事,不再等于“模型大小上限”。

这也是它和很多传统本地推理工具最大的区别。它不是只解决“怎么启动”,而是在重新回答“模型到底应该存在哪里,怎么调度最合适”。

打开网易新闻 查看精彩图片

三、最妙的一步:搬不过去的 Expert,干脆让 CPU 直接算

如果只是把 Expert 存在系统内存里,然后每次需要的时候通过 PCIe 搬到显卡,其实还不够。因为 PCIe 带宽再高,也是有限的。

这个时候 FreeToken 又做了一步非常聪明的优化。

假设当前这个 Token 需要 12 个 Expert,其中 8 个已经在 GPU Cache 里,剩下 4 个不在。最直观的做法,就是把那 4 个全部从系统内存搬进显存,然后交给 GPU 计算。但这样一来,GPU 很可能要在那里等数据,PCIe 一旦成为瓶颈,整体速度就上不去。

FreeToken 没这么干。

它会先根据当前这台机器的真实情况,去估算两件事:一是 PCIe 的搬运速度,二是 CPU 加内存这一侧的计算速度。然后动态决定,哪些 Expert 值得搬到 GPU,哪些 Expert 干脆别搬了,直接留在 CPU 这一边算。

结果就变成了这样一种分工:

一部分 Expert 通过 PCIe 传给 GPU,由显卡来算;另一部分 Expert 直接在 CPU 和系统内存这一侧完成计算。两边同时进行,最后再把结果合起来。

这就是 FreeToken 那套 bandwidth-adaptive CPU-GPU execution 的核心精神。大白话就是:不死磕“全部交给 GPU”,而是根据这台电脑的真实硬件能力,动态分配工作。

这一步非常关键,因为它意味着 FreeToken 不是一套死的规则,而是一种面向具体机器的调度系统。你换一台不同带宽、不同内存、不同 CPU 的电脑,它的分工策略也可能完全不一样。

打开网易新闻 查看精彩图片

四、它不只加速生成,还专门优化了 Prefill

很多人平时只盯着 tok/s,默认大模型快不快,就是看生成阶段快不快。但真到本地推理里,另一个很影响体验的环节其实是 Prefill。

所谓 Prefill,你可以把它理解成模型第一次“吃提示词”的阶段。比如你塞进去一大段 Prompt、一堆代码上下文,或者一整段 Agent 历史,模型要先把这些内容全部处理一遍,后面才能开始连续生成。

如果模型很大,这个阶段会非常慢。

FreeToken 在这里做了一个挺漂亮的优化,叫 full-layer double buffering。它的思路也不复杂:GPU 在计算当前这一层的时候,PCIe 不要闲着,而是提前去搬下一层需要的数据。这样“搬运”和“计算”就能尽量重叠起来,而不是一段一段串行执行。

如果不用这个机制,流程通常像这样:

先搬这一层,再算这一层;算完以后,再去搬下一层;搬完以后,再算下一层。

而用了 double buffering 以后,事情就变成了:GPU 正在算当前层时,下一层的数据已经在路上了。

这类优化听起来有点工程味,但它对应的是非常实际的体验。因为很多人本地跑模型,不是只问一句话就结束,而是要喂很长的上下文,尤其是代码、Agent 和记忆类任务。如果 Prefill 太慢,前面几十秒一直卡着不出字,你就算 Decode 再快,整体体验也还是不好。

这也是为什么作者在帖子里会特别强调,FreeToken 不只是 Decode 更快,Prefill 相比一些传统方案也快很多。

打开网易新闻 查看精彩图片

五、它为什么特别适合 Codex、Claude Code 这类 Agent

我觉得 FreeToken 最值得你写给普通用户看的,不是“模型参数有多大”,而是它已经明显开始针对 Agent 工作流做优化了。

普通聊天的流程很简单,就是你问一句,模型答一句。可是一旦进入 Codex、Claude Code、DeepSeek Harness、Hermes 这种 Agent 场景,整个工作方式就彻底变了。

它经常不是单轮问答,而是:

先思考,再调工具;工具返回以后,再继续思考;接着改文件、跑命令、再调一次工具;过程中还会不断压缩历史、修改上下文、裁剪旧输出。

换句话说,Agent 的上下文不是静止的,而是会不断变化。

传统 KV Cache 在这种场景里有个大问题:只要中间某一段内容发生变化,后面一大截缓存就可能失效,于是模型只能从前面重新算起。对于长会话来说,这个代价会非常高。

FreeToken 在这里专门做了 semantic-aware caching,也就是语义感知缓存。你可以把它理解成:它不会傻傻地只按位置缓存,而是会在一些更有语义意义的地方保存状态,比如 thinking 边界、tool call、tool output、会话轮次等。这样当 Agent 后面修改了上下文时,它可以尽量保留前面还有效的部分,只重算真正变化之后的那一段。

这件事为什么重要?因为本地模型如果想变成“本地 Agent 后端”,就不能只会聊天,还得扛得住长会话、多轮工具调用和不断变化的上下文。FreeToken 在这件事上明显是有准备的。

所以它其实不是一个单纯的“本地聊天引擎”,更像是在朝“本地 Agent 服务器”这个方向走。

打开网易新闻 查看精彩图片

六、它不是自己单玩,Codex、Claude Code、DSH、Hermes 都能接

这也是 FreeToken 很讨巧的一点。

很多本地模型工具喜欢把用户圈在自己的界面里,只让你用它自己的聊天框、它自己的控制台、它自己的交互方式。FreeToken 没走这条路,它做得更像一个后端。

它对外暴露的是 OpenAI-Compatible API 和 Anthropic-Compatible API,也就是说,很多你已经熟悉的工具,其实都能把它当成本地模型服务来接。

这就带来一个很大的想象空间。

如果你平时在用 Codex、Claude Code、DeepSeek Harness、Hermes、OpenCode 这些 Agent 工具,那 FreeToken 理论上就可以成为它们背后的本地模型引擎。作者在文档里甚至已经给出了对应的启动方式,支持把这些 Agent 指向本地服务。

这也是作者那句“现在只需 $0 即可用前沿模型运行您的 Claude 代码或 Codex”真正想表达的意思。

它不是说 Anthropic 或 OpenAI 的官方模型突然免费了,而是说:你可以继续保留 Claude Code、Codex 这套 Agent 工作流,但把后端模型换成本地部署的开源模型。这样一来,你用的还是那套熟悉的工具方式,但不再需要按 API Token 一次次付费。

当然,硬件的钱、电费和内存还是你自己出,这一点要讲清楚。但从使用体验上看,它确实是在尝试把“本地模型”和“现成 Agent 工具”打通。

打开网易新闻 查看精彩图片

七、另一个很大的产品点:不用先转 GGUF,官方 checkpoint 就能跑

对很多喜欢折腾本地模型的人来说,FreeToken 还有一个挺有吸引力的地方,就是它不强迫你先走一大圈模型格式转换。

很多本地工具的常规路线是:先找到一个合适的模型,再去找相应的量化版或者 GGUF 版本,再考虑兼容性、精度和速度,整个过程对普通用户其实不太友好。

FreeToken 当前更强调的是直接读取 Hugging Face 的 safetensors checkpoint。也就是说,模型本身如果已经有官方或半官方可用的 checkpoint,你就可以直接拿来跑,而不一定要先自己转换成 GGUF。

不过这里有个概念必须说清楚:不需要极端量化,不等于完全不量化。

比如作者展示的 8GB RTX 4060 Laptop 跑 Qwen3.6 35B,依赖的是官方 NVFP4 checkpoint;GLM-5.2 那条路线,也用的是 NVIDIA 官方 NVFP4 版本。DeepSeek-V4-Flash 本身也有适合这种推理路径的低精度格式。

所以正确的说法应该是:

FreeToken 不要求你自己去做那种很激进的极端量化,也不要求你先折腾一大堆转换流程,而是尽量直接利用已经存在的官方 checkpoint 体系。

这件事的价值在于,它把“试一试”这件事的门槛降下来了。你不用先在模型格式上折腾半天,再来判断能不能跑。

打开网易新闻 查看精彩图片

八、适合哪些人上手,现阶段又该怎么理解它

如果你只是看热闹,容易觉得 FreeToken 已经是一个谁都能闭眼装的成熟大众产品了。其实还没有。

它现在更像一个非常新、但方向很值得关注的项目。适合的人群,首先还是喜欢折腾本地模型、显卡和 Agent 的这批朋友。如果你手上本来就有 RTX 40 或 RTX 50 系显卡,又不排斥折腾系统内存、驱动、模型下载和本地部署,那它很值得一试。

而且有一点必须反复提醒:别只盯着显卡,也要看内存。

作者给出的几组漂亮数据背后,都有一整套硬件条件支撑。4060 Laptop 那组配置有 32GB 内存;5090 跑 DeepSeek-V4-Flash,背后是 192GB 内存;更夸张的 GLM-5.2 753B,则用了 512GB 内存。也就是说,如果你的机器只是“5090 + 32GB RAM”,那和作者那台“5090 + 192GB RAM”根本不是一个级别。

所以 FreeToken 打破的是“显存决定一切”这个旧观念,但并没有打破物理内存的边界。它只是把“系统内存也能认真参与推理”这条路线走通了。

从使用方式上看,普通用户现在更适合先看桌面版。作者已经展示了 FreeToken Desktop,有模型管理、运行状态、速度、缓存配置这些可视化界面,Windows 和 Linux 也都有一键安装路线。对不想一上来就编译源码的人来说,这条路显然更友好。

所以现阶段我对它的评价会更接近一句话:

它已经足够让喜欢折腾的人玩起来了,但还没到“什么都不懂也能无脑上”的程度。

打开网易新闻 查看精彩图片

九、最后:FreeToken 真正值得关注的,不只是 5090 跑 284B

如果只把 FreeToken 写成一篇“单卡 RTX 5090 跑 DeepSeek V4 284B”的硬件新闻,其实有点可惜。

因为这个项目真正有意思的地方,不是又冒出来一个更快的本地推理工具,而是它在试图改写一个大家习惯了很久的思路:本地模型的上限,不该只看显存。

在 MoE 模型时代,这个变化尤其重要。因为 MoE 的总参数可以非常夸张,但每个 Token 实际激活的参数又没有你想象得那么多。既然如此,为什么不能把系统内存当成大仓库,把显卡当成高速缓存,把 CPU 当成辅助计算单元,再让 PCIe 负责动态搬运和调度?

FreeToken 本质上就是在认真回答这个问题。

而且它回答的方式,不只是论文里的概念,而是已经落到了真实工程里:它在考虑 GPU Cache、CPU-GPU 协同计算、Prefill 管线优化、Agent 缓存、OpenAI / Anthropic 接口兼容,以及如何直接接到 Codex、Claude Code、DeepSeek Harness 这种实际工作流里。

所以它给人的感觉已经不只是“本地大模型播放器”,而更像是在尝试做一个面向 Agent 时代的本地推理底座。

如果你手上正好有 RTX 40 或 50 系显卡,又有比较宽裕的系统内存,还喜欢折腾 Codex、Claude Code、DeepSeek Harness 这些工具,我觉得这个项目确实值得你下载下来试一试。

特别是那些以前总觉得“284B 这种模型离我电脑太远”的朋友,现在至少可以说一句:

它还不属于大众,但已经有人把路趟出来了。

打开网易新闻 查看精彩图片