作者丨李娜
编辑丨岑峰
一张大模型架构图里,同时出现了 Kimi 和 DeepSeek 的影子。
01
MiniMax最后还是留下了Full Attention
要回答这个问题,可以看看MiniMax过去几年的架构变化,几乎完整经历了这一轮反复:从押注线性注意力,到保留少量全局注意力做混合注意力,再回到全局注意力,后来又转向稀疏注意力。每一次变化背后,都对应着模型Scale以后新暴露出来的问题。
02
Scale之后,混合注意力又暴露了新问题
模型继续Scale以后,第二轮问题出现了。这一次是更复杂的多跳推理问题。当模型需要经过多个中间步骤,把前面的条件、推导和结论重新串起来时,混合注意力开始出现比Full Attention更明显的能力损失。问题暴露以后,团队重新设计测试和训练方法,小规模实验里,混合注意力又可以追上Full Attention。真正让MiniMax犹豫的也因此不再是这个具体缺陷,而是另一件事:这次的问题可以找到、可以修,下一次还没有被发现的问题在哪里?Text-01时期使用的Benchmark,并没有提前暴露后来的多跳推理差距。即使团队为这个问题补上新的测试,也无法证明在更大的模型和更复杂的任务上,不会继续出现新的能力缺口。这意味着,混合注意力真正的风险是未知能力损失无法被提前穷尽。
03
Agent重新放大了Full Attention的成本
M2回到Full Attention之后,MiniMax并没有在那里停太久。2026年6月发布的M3重新离开Full,转向自研的MiniMax Sparse Attention(MSA)。这一次,变化来自于模型要处理的任务。Text-01时期,长上下文更多意味着一次性读进更多材料:一本书、一份报告,或者几十万token的文档。到了Agent阶段,上下文开始变成一段不断增长的工作历史。搜索结果、网页、代码、工具返回、报错和中间结果,会随着任务一轮轮执行不断累积。一个Agent可能工作几十轮甚至更久,前面发生过的事情又不能轻易丢掉。这让Full Attention的另一面越来越难忽视。M2时期,MiniMax最担心的是高效Attention可能带来的未知能力损失,因此宁愿接受Full Attention更高的成本。但到了M3,长程Agent开始把这笔成本不断放大:历史越长,每一轮需要处理的信息越多,计算和KV Cache都会继续增长。MiniMax在M3发布时把“Context Scaling”直接列为解决复杂Agent任务的核心问题,并重新从Attention架构动手。最终采用的MSA不再让每一步都处理完整历史,而是先从长上下文中筛出真正需要参与Attention计算的部分。官方数据显示,在100万token上下文下,M3单token计算量约为上一代模型的1/20。于是,MiniMax几年的路线看起来像是绕了一圈:Text-01用Linear降低长上下文成本,同时留下Full Attention兜底;M2因为Scale后暴露出的能力风险,重新回到Full;到了M3,Agent又把长上下文成本推到前台,于是团队再次寻找Full Attention之外的方案,只是这一次选择了Sparse。M2时,MiniMax愿意用更高的计算成本换能力上的确定性;到了M3,Agent让这份“确定性保险”的价格变得越来越高。
04
Linear和Sparse被放进同一个模型
MiniMax重新走向Sparse时,类似的变化已经开始在其他模型里出现。过去很多混合注意力架构虽然引入了更高效的Attention,最后仍会保留少量全局Attention。到了2026年,这个结构开始松动。2月发布的MiniCPM-SALA直接把Lightning Attention和Sparse Attention放到了一起;到了8月,Qwen3.8-Flash-Next延续此前三层Gated DeltaNet配一层Attention的结构,却把负责精确检索的那部分进一步改成了Qwen Sparse Attention。这个变化在Qwen身上尤其清楚。三比一的结构没有变,变的是那一层“兜底”的方式。过去由全局Attention直接读取完整历史,现在开始交给Sparse Attention,从长上下文中筛出真正需要的信息。到了GLM-5.3-Flash,类似的组合再次出现:45层模型中,34层采用KDA,另外11层采用KPool-DSA。过去分别由Kimi和DeepSeek推进的Linear与Sparse路线,被放进了同一套模型。Linear和Sparse之所以能够放在一起,恰好因为两者解决的是不同的问题。Linear擅长用较低成本维持一段很长的历史,却不擅长随时恢复其中某个具体细节;Sparse保留token级历史,但每次只读取其中一小部分。前者更像负责“记住整体状态”,后者负责“需要时回去查具体内容”。这也是为什么两种过去看起来彼此竞争的方案,后来开始出现在同一套架构里。三个模型的实现并不相同,但它们指向了一个共同变化:Attention架构正在从寻找一种更好的机制,走向让不同机制承担不同的工作。Linear或Recurrent Attention负责以更低成本维持长历史,Sparse Attention负责在需要时从中找回更具体的信息。
过去被当作不同路线讨论的Linear、Sparse和Full,正在变成同一个架构设计空间里的不同选项。
05
技术开始越过公司的边界
这种组合越来越容易发生,也和过去几年技术扩散的方式有关。2024年,长期研究线性注意力的杨松琳开始维护线性注意力开源社区FLA。她后来回忆,FLA从一开始就不只是为了发布论文,而是希望把Linear Attention变成真正可以复用的基础设施:算法之外,接口、kernel和具体实现也一起开放。后来Kimi推进KDA时,也从这个社区吸收了核心贡献者。技术因此不再只跟着论文流动。代码、社区和研究人员,把一项架构创新带出了最初提出它的团队。到2025年底,杨松琳在讨论Linear Attention下一步时,已经提出过一个当时还很激进的方向:既然Linear在精确检索上仍有缺口,是否可以直接和Sparse结合,让两种机制各自处理不同的问题。她当时举出的例子,就是Kimi的KDA和DeepSeek的DSA。不到一年,这种设想已经出现在真实模型里。这也让“技术路线”越来越难简单地和某一种Attention机制绑定。过去人们习惯说MiniMax做Linear、DeepSeek做Sparse、Kimi做KDA;但当代码可以开源、人员可以流动、已经被验证过的技术可以迅速进入另一家公司的模型,这些标签的有效期会越来越短。真正拉开差距的,也越来越不是“有没有某项技术”,而是什么时候采用它、怎样和其他技术组合,以及愿意在能力、成本和工程风险之间做什么取舍。
06
尾声:路线没有消失
再回到开头那张架构图,Kimi和DeepSeek的名字同时出现在GLM-5.3-Flash里,已经没有那么反常了。过去几年,人们习惯用Linear、Sparse、Full Attention来区分不同公司的技术路线。但MiniMax几次看似反复的选择,其实已经说明,这种划分越来越难解释真实的大模型研发。做Text-01时,MiniMax最先看到的是长上下文带来的成本,于是押注Linear;模型继续Scale以后,未知的能力损失变得更危险,M2因此重新回到Full;到了Agent阶段,不断增长的工作历史又把计算成本推到前台,M3再次转向Sparse。技术没有突然变好或变坏,变化的是每个阶段最先撞到的约束。这也解释了为什么今天很难再用一种Attention机制定义一家公司的路线。真正决定选择的,是模型下一步要处理什么任务,什么成本已经不能继续接受,以及团队愿意为能力上的确定性付出多少代价。GLM-5.3-Flash里KDA和DSA同时出现,记录下来的也不是哪一条路线最终赢了。它更像一个结果:当具体技术越来越容易被验证、吸收和重新组合,所谓“路线”正在从对某一种架构的长期押注,变成一家公司对约束变化的持续判断。技术会扩散,也会被重新组合。真正没有那么容易被复制的,是一家团队判断下一堵墙会出现在哪里。参考资料:1.晚点聊 LateTalk 104:《我给线性注意力找“金主”,字节 say No,MiniMax say Yes》2.MiniMax:《MiniMax-01 is Now Open-Source: Scaling Lightning Attention for the AI Agent Era》
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
热门跟贴