智猩猩AI整理

编辑:林夕

Qwen这次又玩了一次提前剧透,预告了一款新模型——Qwen3.8-Flash-Next

它直接采用下一代Qwen4架构,提前把Qwen4的技术路线摆到了桌面上。

打开网易新闻 查看精彩图片

按照目前ModelScope官方预告信息,Qwen3.8-Flash-Next将在北京时间8月26日23:00左右开放权重,原版与FP8双版本同步放出。

打开网易新闻 查看精彩图片

为什么选择提前开源?

官方的说法是让社区提前准备runtime、量化方案与inference engine,模型还没正式落地,生态已经开始跟进。

Unsloth联合创始人Daniel Han随后确认团队在做day-zero支持。

打开网易新闻 查看精彩图片

同时,在预告页刚上线时还放了一段完整的Highlights,但很快被官方删除。

@AiBattle在X上及时截到了全文,这是目前关于这次发布最完整的一手文字记录:

打开网易新闻 查看精彩图片

01

参数、记忆、Attention,

Qwen开始全面做稀疏

删掉的Highlights里,信息密度最高的是第一行:125B主模型参数、额外51B的 N-gram Embeddings、每token激活6B。

其实回答的是同一个问题:怎么让模型知道得更多,同时算得更少?

(1)125B参数,却只激活6B

6B的激活量,是MoE最核心的一笔交易,模型内部被切成大量专家网络,每个Token到来时,由路由器挑出少数几个专家参与计算,其余专家全部休眠。

所以,125B是模型的总容量,6B是每个Token真正付出的计算量。算力账按6B付,知识容量按125B存。

而这个剪刀差,正在被Qwen一代代拉大。

Qwen3-Next-80B-A3B是80B存、3B付,占比3.75%;Qwen3.8-2.4T-A95B是2.4T存、95B付,约4%;到了Flash-Next,125B只激活6B,占比约4.8%。

存得越来越多,真正需要算的却越来越少,然而这条曲线不是自然形成的,而是Qwen在主动把模型容量和计算成本拆开。

当然,在这三个数字里,125B和6B其实还算Qwen的常规操作,真正反常规的,是旁边那块51B。

(2)51B N-gram,到底是在干什么?

51B N-gram Embeddings,可以理解成一张可以训练的巨型查找表。N-gram指连续几个Token组成的局部组合。

比如“人工”“智能”连续出现,可以形成2-gram;代码里的for i in,则可以形成3-gram。

模型会根据最近几个Token计算相关信息,再通过Hash找到对应位置,从表里取出向量,混入当前的hidden state。

它有点像一本随查随用的常用短语手册,高频的局部搭配,不必每次都让主模型重新计算;能查到的,直接拿来用。

主网络因此可以把更多计算预算留给真正需要理解、推理和决策的问题。

但看到51B,第一反应很容易是:这么大的参数量,不会把推理成本直接炸掉吗?

关键就在于,它不是把51B参数每次全部算一遍,每个Token只会访问其中极少数N-gram条目,读取对应的向量,再参与后续计算。

所以它的成本结构和普通稠密权重完全不同:

51B主要贡献的是存储容量,而不是每个Token对应的等比例计算量。

这也是Flash-Next最值得关注的地方之一:Qwen不是简单地继续给模型堆参数,而是在尝试给主模型外挂一套超大规模、稀疏访问的记忆。

而到了Attention,这套把存储和计算拆开的思路还在继续。

Qwen又开始动Attention了

这次动了两个地方:一个是延续,一个是全新。

延续的是GDN(Gated Delta Network),属于线性注意力路线。

它维护一个固定大小的recurrent state,通过learned gating和Delta rule持续更新,状态规模不会随着序列长度不断膨胀。

打开网易新闻 查看精彩图片

传统Transformer则是另一套账,每产生一个Token,就继续往KV Cache里堆一份Key和Value。上下文越长,这本历史账本就越厚,显存和计算压力也跟着上升。

GDN做的事情,就是用固定规模的state,替代这本不断变厚的账本。

但纯线性注意力有一个问题:精确检索能力通常不如全注意力,所以Qwen的解法不是彻底抛弃Transformer,而是做混合。

大部分层走GDN,少量层保留全注意力,在效率和精确检索之间做平衡,Flash-Next延续了这条路线,配置为69层GDN + 23层全注意力,仍然是3:1的比例

但这次又多了一个全新的组件:QSA(Qwen Sparse Attention)

这也是目前预览信息里最大的悬念,具体实现还没有公开,但从命名来看,它针对的正是Attention本身的稀疏化。

如果GDN解决的是大部分序列计算的效率问题,那么QSA进一步瞄准的,就是混合架构里剩下的全注意力计算

也就是说,Qwen连最后这块高成本区域,也开始动手了。

02

Qwen为什么开始

疯狂强调Long-Horizon?

线索藏在官方的话术里。Highlights 强调的 agentic coding、long-horizon tasks、multimodal intelligence,前两个词都指向小时级的任务。

Long-horizon 意味着什么?一个agent写代码,可能要跑几百轮工具调用,上下文累积到几十万 token任务本身的长度成了负载

比如一个Coding Agent,从理解需求开始,到读代码、改代码、运行测试、读取报错,再继续修改,可能要经历上百轮工具调用。上下文一路累积,最后真正成为模型的负载。

传统Transformer在这个场景下有一笔死账。KV cache随token数线性堆积,长任务跑到后半程,算力大量花在搬运历史上,而不是生成新内容。

这也是为什么回头看Flash-Next这套架构,会发现前面那些看似分散的设计,其实都在解决同一个问题。

GDN用固定规模的state压住长上下文成本;N-gram通过稀疏查表处理局部模式;QSA则进一步压缩Attention本身的计算。

它们没有一个是单纯为了让短对话更快。目标很明确是让模型能够在更长的任务里持续工作,同时不要让计算成本跟着任务长度一起失控

这也顺带解释了6B激活的定位。agent的调用是高频、批量、长尾的,推理单价直接决定这类应用能不能成立:单次调用便宜还不够,跑一整天不破产才算过关。

Highlights的最后一条:训练成本约为Qwen3.7-Plus的1/9,整体能力相当,coding与cowork场景更强。

所以Flash-Next强调的,其实不是单纯的低成本模型,而是让低成本成为Agent长时间运行的基础设施

这套架构最终要回答的,还是一个非常现实的问题:这么多改动,究竟换来了什么?

Highlights给出的答案是:训练成本约为Qwen3.7-Plus的1/9,同时整体能力相当,并在coding和cowork场景更强。

这个数字目前还需要等完整技术报告和实际训练细节进一步验证,但它至少说明了Qwen在这代架构上追求的方向。

而且,这并不是Qwen第一次把成本直接写进模型发布材料。

此前Qwen3-Next发布时,官方也曾给出过类似的效率对照:训练计算量仅为Qwen3-32B的9.3%,但Qwen3-Next-80B-A3B-Instruct的整体表现已经接近Qwen3-235B-A22B旗舰模型。

这张图就是当时的能力对比。

打开网易新闻 查看精彩图片

两次发布相隔一年,方向没有变过。容量往上堆,成本往下压,中间的差额就是架构设计赚出来的钱。

03

Qwen4已经进入

正式发布前的倒计时

8月3日,Qwen3.8-Max闭源发布;8月12日,Qwen3.8-2.4T-A95B开源;8月中旬,27B稠密版跟上;8月26日,Flash-Next亮相,直接给出了下一代Qwen4架构的预览。

短短几周,Qwen几乎是两周一个版本

如果参考Qwen3-Next从架构预览到后续正式采用的节奏,Qwen4完整家族距离正式亮相,可能已经不是遥遥无期,而是进入了以月为单位的倒计时。

而Flash-Next真正的角色,也就越来越清晰了。

它更像是Qwen4的先头部队:提前把下一代架构的成本结构、稀疏策略和N-gram外挂记忆摊到台面上,让推理框架、量化工具和开源社区先适配,让开发者先跑起来,也让用户先验证这套架构究竟能不能打。

所以,Qwen4还没有正式登场,但从Flash-Next开始,下一代Qwen已经把第一块底牌摆到了桌面上。

今晚23点,等权重真正落地,这场关于Qwen4的提前预演,才算正式开始。

关注+星标,获取AI前沿进展与开源一线动态