我本来以为,显存越大越稳。

结果测完四个组合,直接打脸。

打开网易新闻 查看精彩图片

DGX Spark(121GB统一内存)跑全精度Qwen3.8-27B,单用户只有6.7 tok/s,开着投机解码也一样,基本废了。 同一台机器换上Ling-3.0-flash(INT4 MoE),立刻能到39~55 tok/s。

两张魔改48G的4090 + Ling,直接拉到145 tok/s,差不多是同机Qwen的3倍。

更扎心的是:真正决定“能同时服务多少人”的,不是算力,也不是总显存大小,而是装完模型后还剩多少空间给KV缓存

很多人买卡只看参数表,这轮实测告诉你——推理时,带宽和激活参数量才是命门。

为什么会差这么多?

打开网易新闻 查看精彩图片

用大白话说:

  • Dense模型(Qwen):27B参数,每生成一个字,27B全部要过一遍。
  • MoE模型(Ling):总共127B,但每次只激活大约5B,大部分专家在睡觉。

生成文字时,GPU大部分时间不是在“算”,而是在“搬”权重。 搬得快不快,看显存带宽;激活越少,搬的量越小,速度就越快。

打开网易新闻 查看精彩图片

双4090带宽碾压Spark,Ling激活量又远小于Qwen,两个优势叠在一起,就出现了145这个数字。 但代价也很明显:Ling理论上限能到800左右,实际只拿到145,硬件利用率大概只有10%。极致的速度和极致的浪费,同时存在。

打开网易新闻 查看精彩图片

真实写代码任务里,倍数会缩水

我拿同一个网页动画任务(写代码、改、返工),在双4090上让两个模型完整跑了一遍。

代码量几乎一样(差0.3%)。 Ling用了69分钟,Qwen用了133分钟,大约1.94倍。

短提示词测出来是2.88倍,真实长会话只剩1.94倍。 上下文一长,读上下文的开销变大,MoE靠稀疏省下来的带宽优势就被稀释了。

benchmark越短越好看,真实会话越长越打回原形。

现在让我选,我会怎么选

一个人或小团队,主要写代码: 我选Qwen(Dense)。 速度慢一点(500 token大概10秒 vs Ling的3.4秒),但输出更稳、生态更成熟。写代码时,一次错误浪费的时间,远超过那几秒等待。

要做多人服务(内部工具、类豆包前端): 直接选Ling这种低激活MoE。 同一台双4090,Qwen大概撑36人到体验线(20 tok/s),Ling能到72人。成本直接砍一半。

打开网易新闻 查看精彩图片

两台机器都有的话: 别二选一。让它们分工——Qwen负责规划拆任务,Ling负责快速执行。长会话拆成短任务后,MoE的速度优势会回来。

买之前先问自己这四个问题

  1. 模型装不装得下?(权重 + KV空间)
  2. 每个token实际激活多少参数?
  3. 显存带宽够不够?
  4. 你是一个人用,还是要同时服务几十个人?

这四个问题答完,该买什么基本就清楚了。

打开网易新闻 查看精彩图片

我测的是当前配置下的真实数据。Spark的KV如果调满,人数可能还能再高;投机解码参数再调,Ling还有空间。但方向不会变。

现在让你选: 双4090还是DGX Spark? 评论区直接说,别藏着。