刚看到消息,感觉太扯了,又是噱头?半天憋一个字的那种,能部署,不能用,有啥意义?

仔细研究了一下,牛X!

确实在RTX 5070 12GB显卡上,跑起了 Qwen3.8-Flash-Next,这是125B的大模型,1000多亿参数!

打开网易新闻 查看精彩图片

而且不是便秘输出,短文本最高能到90多个token/s,单显卡最强模型不再是Qwen3.8-27B了,现在新王是Qwen3.8-Flash-Next了。

具体什么技术?咋实现的千亿模型塞进12G显存的?

这个项目是Strata,是一个推理引擎,简单来说,就是一个”模型运行工具“,它基于llama.cpp,专门针对Qwen3.8-Flash-Next(125B MoE)做的深度优化。

Strata最大特点就是把模型分层存储:(不只放显存了)

  • 显卡:只放最高频的专家(experts)
  • 内存:全部专家权重,显卡没缓存的专家,由CPU在内存中计算,CPU和显卡可以同时干活。
  • 固态硬盘:放巨大的n-gram查找表。

这么操作一番,直接把千亿大模型,压到游戏电脑显卡,12G显存就能跑,同时叠加MTP推测解码技术,增加1.6倍输出速度,每秒输出50+,正经能用,不是样子货。

具体需要什么配置,我的电脑能不能跑?

黑虾整理一个简单对照:

配置

建议尝试

简评

12GB显卡+32GB 内存

Coder 版本

它删掉了一半专家,主攻代码;有网友实测,有点智障,不太建议。

12GB显卡+48GB 内存

Q2_0 或 IQ2_XS

完整专家版本。

12GB显卡+64GB 内存

IQ2_XS 优先;也可试 IQ3 版本

IQ3版本最好,输出53t/s左右。

12GB显卡+96GB内存

IQ3_S,或 Unsloth 的 UD-IQ4_XS(约 4-bit)

可以探索IQ4量化了,属于常规不降智量化了。

12GB显卡+128GB内存

UD-IQ4_XS

为所欲为,模型随便选。

1、表里的12G显卡,大于12G当然也可以,比如16G的5060Ti或5070Ti 16G,然后内存最好是64G。

2、这个项目大大降低了,对显卡显存的要求,但显存仍然有价值。更多显存可以留下更多常用专家,让 CPU 少接手一些活,项目也明确表示,增加显存会增加输出速度。

3、输出速度并不统一,不同CPU和内存,会有差异。具体来讲,高性能CPU,DDR5高频内存,高速固态硬盘,PCIe5.0的主板,这些都有利于提升输出速度。

4、给准备新装机的小白,也别只看”12GB 能跑 125B"这一句话。显卡要求是低了些,但内存要求没低,内存也不便宜 。5070 12G显卡8000多块、64G的DDR5内存又得8000多块,这就1万6了,所以整机下来,至少也要到2万块档了,而这个价格可以订阅10多年GPT Plus会员了,所以不要太冲动买硬件,具体还是要看个人使用需求。

如何部署:

不同电脑的配置不同,能部署的模型版本也不完全一样,所以这里就不贴详细部署教程了。

另外现在有Agent了,直接让Agent安装最省事,把下面这段话发给Agent就行(比如WorkBuddy,Codex,豆包工作模式)。

Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.

它会检查你的显卡、内存和硬盘,选出合适的模型,然后安装并启动。

打开网易新闻 查看精彩图片

如果想手动探索安装也可以,项目介绍里有的,这里是项目开源地址:https://github.com/Niko1221/Strata

显卡价格会因此崩吗?

笔者个人判断:应该不会,起码短期不会。

这个技术路径,把部署门槛降低了,不必须顶级显卡了,但还是需要显卡,且因为能够得着的用户变多,甚至有可能推升显卡需求。

最后:

这次Strata比较牛的就是,它开启了一个很好的技术路径,就是不只依赖显卡显存了,它把内存、硬盘和处理器都用起来。这个项目开了个头,就像“龙虾Agent”给Agent开了个头一样,后面随着技术迭代,本地部署模型的门槛,会越来越低,能力越来越强,输出速度越来越快,未来可期。

以上,希望对你有帮助。

如果想了解更多 AI 大模型本地部署,可以关注我,我会分享各种模型的部署方法和教程。

有问题评论区见。