打开网易新闻 查看精彩图片

爆火 9 天的 Strata,号称 12G 显存跑 180B 大模型。我把仓库 README、HuggingFace 模型页和原始推文逐条对了一遍,结论是模型和速度都是真的,但推文把三个关键条件全藏了。本文用 5 张图说清它到底值不值得装。

前几天刷 X,看到一条转了不少次的推文,说有个开源项目能让 12G 显存的游戏卡跑 128B 大模型,速度到96 token/s。我第一反应是吹牛,128B 的权重光存下来就要七八十 GB,12G 显存怎么塞得进去。

顺手把这个叫Strata的仓库和它背后模型的 HuggingFace 页面都翻了一遍,还专门核对了官方跑分表和社区测试。东西是真的,推文也没撒谎,只是把条件全藏了。下面用数据讲清楚。

先搞懂它跑的是什么

Strata 跑的模型叫Qwen3.8-Flash-Next,Qwen 官方 8 月底发布,HuggingFace 上 140 万次下载、5800+ 赞,总参数180B。这个量级能塞进家用电脑,靠的是 MoE 架构。

打个比方,它像一家有 512 个顾问的公司,每个问题进来只叫醒几十个相关的干活,其余的继续睡觉。睡觉的顾问不占工位,办公室就能租小一点。落到电脑上是同一回事,12G 显存放常驻骨干和当前激活的专家,其余专家权重放在系统内存里,用的时候再搬。

96 token/s 是怎么来的

推文里的96 token/s,最接近的官方数字是94,在 RTX 5070 上测出。但 README 里这是压缩最狠的 2bit 档位(Q2_0)的成绩。想智商掉得少一点,换保留最全的 IQ3_S 档,速度立刻掉到53。快和聪明,现阶段只能选一头。

显卡之外,内存才是真门槛
打开网易新闻 查看精彩图片
显卡之外,内存才是真门槛

推文没说的第二件事,是内存。官方配置清单写着内存32GB 起步、64GB 才舒服,硬盘再腾 80GB。四个档位里最轻的也要 37.6GB 内存加显存合计,最完整的 IQ3_S 要 54.8GB。

这套方案筛选的是「12G 显存 + 32G 内存」的玩家。只盯着显存看,大多数人的机器会卡在内存这一关,装了也跑不起来。

真机监控图比推文诚实
打开网易新闻 查看精彩图片
真机监控图比推文诚实

README 里有一张 5070 真机运行的监控截图。左边面板显示,出字速度50.4 token/s,显存占用11.2/12GB,GPU 温度 54 度。这张图比推文实在,它同时证明了两件事,速度确实是几十 token/s 的水平,12G 显存也确实刚好够用,一点富余都没有。

打开网易新闻 查看精彩图片

Strata 官方 README 真机截图,左为监控面板,右为模型实时写代码的画面

喂长文档会掉速

日常短聊确实快,但把 32K 的长文档喂进去,读题就要15 秒到 1 分钟,之后追问才恢复秒回。128K 超长上下文下,出字速度还会再掉两成左右。想拿来啃长报告、读代码仓库,这个体验要有心理预期。

推文说法 vs 官方文档
打开网易新闻 查看精彩图片
推文说法 vs 官方文档

我把推文和官方文档逐条对了一遍,差距全在没写出来的条件里。

推文给你的印象

官方文档的完整说法

12G 显存就能跑

显存 12G 没错,内存要32GB 起步,硬盘再吃 80GB

速度能到 96 token/s

最狠压缩档94,保留最全的档只有53

跑的是 128B 大模型

官方权重180B总参数,速度是拿压缩换的

感觉是黑科技突破

MoE 加内存卸载,llama.cpp 生态有同类玩法,Strata 胜在一键装

⚠️ 上桌前想清楚三件事

第一,2bit 是智商税档位。Q2_0 拿智商换速度,简单聊天感觉不出来,复杂推理和中文长文上掉档明显。相当于雇了个 180B 头衔的顾问团,每次只让他们带着小抄干活。

第二,项目太新,作者匿名。仓库开源第 9 天冲到7500+ Star,作者是 2021 年注册、只有这一个仓库的匿名账号。代码是真 C++ 全家桶,但这个传播速度明显有推广矩阵在推。早期 issue 里已经有 AMD 显卡超时、启动内存溢出的报告。

第三,供应链要留个心眼。一键安装脚本会往你电脑下载编译好的引擎直接跑。介意的话,先读源码再装,或者放进虚拟机里玩。

适合谁已经很清楚了。有 12G 显存游戏卡、内存 32G 以上、想体验本地大模型,值得试。8G 显存、16G 内存的主流配置,这项目和你没关系,不用焦虑。它真正指出的方向是,硬件没变,靠软件工程把大模型的门槛硬往下拽,等 4bit 档位在 24G 卡上跑顺,本地大模型才算真正上岸。

觉得有用,关注 AI智管局

下期拿真机装一台 Strata,实测中文能力到底掉多少

文 · 小王 · AI智管局

参考来源,Strata 仓库 github.com/Niko1221/Strata · 模型页 huggingface.co/Qwen/Qwen3.8-Flash-Next · 原始推文 x.com/daluoseo。速度与内存数据均来自项目官方 README 与 docs/MODELS.md。