来源:市场资讯

(来源:华为计算)

上海AI实验室正式开源基于Mobius系列架构训练的Intern-S2-Mobius。该架构通过解耦知识存储与组合推理,探索提升模型推理效率、持续学习、组合泛化的新路径。现有实验显示,在下游任务准确率不低于对照模型的情况下,Mobius端到端推理效率 Transformer提升近4倍,并在数据压缩率和知识组合泛化任务中展现出进一步潜力。该模型基于昇腾384超节点上实现原生训练和推理,联合昇腾共同优化的Mobius架构,在Xtuner训练与LMDeploy推理框架下的运行表现相对于Transformer提速明显。在昇腾超节点算力架构的加持下,未来有望激发出Mobius更大的效率潜力。

伴随着单纯依靠扩大数据量和参数规模所带来的边际收益逐步趋缓,AI模型研发正处在从规模扩展走向结构创新的关键阶段。如何在“Scaling Law”之外寻找新的能力增长路径,已成为学术界和产业界共同关注的问题。

上海人工智能实验室(以下简称上海AI实验室)近日正式开源 Mobius系列架构,该架构将知识存储与组合推理解耦,旨在拓展模型在持续学习、组合泛化等方向上的能力边界,并以架构层面的能力提升进一步推动训练和推理效率优化。

Github链接:https://github.com/InternLM/Intern-S2-Mobius

Huggingface链接:https://huggingface.co/internlm/Intern-S2-Mobius

Arch Space链接:https://github.com/InternLM/archspace/issues/9

Transformer的“三重瓶颈”

自Transformer问世以来,工业界通过持续扩展数据量和参数规模,以较高的投入产出比推动模型能力快速提升。相关模型在自然语言、代码、数学、视频等任务上取得了前所未有的进展。

但随着基于Transformer的模型规模不断扩大、能力持续增强,架构层面的三类局限也日益值得关注:

学过的知识,难以快速、完整地调用;

新知识的高效写入与稳固记忆,成本较高;

未直接学习过的内容,难以通过知识联想与组合进行构建。

在一种常见的解释框架下,前馈神经网络(Feed-Forward Network,FFN)主要承担知识存储功能,注意力机制(Attention)主要负责组合推理。不同层的FFN存储不同知识,同一词元(Token)在不同层可能激活不同信息;不同层的 Attention则完成不同形式的组合,同一组知识输入也可能产生不同的推理结果。由于Transformer按层顺序计算,当前层的 Attention主要处理此前层级产生的表征;借助层间残差连接(Residual Connection),更早层级的信息也可以被传递到后续层。

从这一层次化的记忆与推理机制出发,可以看到三个具体限制:

在推理过程中,模型需要依次经过各层才能调用分散存储的知识。如果关键知识未在恰当阶段被激活,模型往往需要延长生成过程,以增加后续再次调用相关知识的机会;

知识分散在不同层中,既可能重叠,也存在耦合。学习新知识时,模型难以对写入位置进行显式管理,通常需要联动更新大量参数;

不同层之间的信息交互主要依赖残差连接。随着层数加深,较浅层信息可能被逐步稀释,从而限制跨层知识直接组合的效率。

由此可见,分层的记忆与推理机制不仅影响知识读取效率,也增加了知识写入和跨层组合的难度。构建更高效、更灵活的记忆与推理机制,可能成为进一步拓展AI模型能力边界的重要方向。

围绕上述问题,国内外头部基础模型团队都在积极探索 Transformer的架构改进。其中,一类代表性方向是利用稀疏注意力、线性注意力等机制降低计算复杂度,以缓解算力约束、提升训练和推理效率。在资源受限的条件下,这些方案为更大参数规模的训练提供了支撑,也推动国内模型能力逐步接近国外闭源模型。但从长期看,降低复杂度主要解决的是效率问题;这类架构能否同步拓展模型的能力上限,仍需持续观察和验证。

Mobius:解耦知识存储

与组合推理

针对上述问题,上海AI实验室提出一种新的架构思路:拆解不同层中记忆与推理的耦合关系,将各层知识统一组织为共享记忆池,使每一层的Attention都能够访问其中的信息。在这一设计下,上述三类问题有望得到缓解:

在推理层数相同的情况下,共享记忆后的模型能够更多次遍历(Traversal)知识,提高提取关键信息的概率,从而更容易生成有效输出;

知识采用扁平化组织后,新知识的写入位置更加清晰,有助于降低局部更新对整体知识结构的扰动;

每次访问共享记忆库时,所有知识都有机会被同时激活,从而增加不同知识直接交互的机会,并有望带来更好的组合泛化能力。

现有实验显示,在下游任务准确率不低于对照模型的情况下,Mobius端到端推理效率较Transformer提升近4倍。此外,Mobius也在知识写入和组合泛化方面展现出积极信号:使用 60%的数据,Mobius即可达到与Transformer相近的MMLU PRO评测分数,体现出更高的数据压缩效率;在部分知识组合泛化任务中,其表现达到Transformer的2倍效能。

35B续训练的推理速度
打开网易新闻 查看精彩图片
35B续训练的推理速度
35B续训练的CoT长度
打开网易新闻 查看精彩图片
35B续训练的CoT长度
35B续训练的下游任务得分
打开网易新闻 查看精彩图片
35B续训练的下游任务得分
7B从头预训练的MMLU分数
打开网易新闻 查看精彩图片
7B从头预训练的MMLU分数
Toy Model的组合泛化验证
打开网易新闻 查看精彩图片
Toy Model的组合泛化验证

原生支持反向残差连接与动态隐空间推理

近期围绕残差连接(Residual Connection)和隐空间推理(Latent Reasoning)的架构改进受到广泛关注。

从这两个视角看,Mobius的设计可以被理解为原生支持反向残差连接(Backward Residual Connection)和动态隐空间推理(Dynamic Latent Reasoning)。

从早期的ResNet,到近期的Hyper-Connection、Attention-Residual,这类机制的共同目标之一,是在前向传播过程中将浅层信息传递至深层。其局限在于,前向信息流仍主要沿层级单向展开,当关键知识未被及时调用,或深层知识构成浅层知识的读取前提时,模型可能需要通过额外生成延长推理过程。

Mobius将不同层的知识统一组织起来,使后续计算能够重新访问此前层级的知识;从机制上看,这可以理解为引入了一种反向残差连接,有望增强信息传递的灵活性,并改善知识压缩率和推理效率。

相比逐Token的显式推理,隐空间推理使用隐状态(Hidden States)连接不同循环,也发挥了类似残差连接的作用。但传统隐空间推理仍存在效率约束:一方面,模型每次循环通常都要经过所有层,即使部分层的知识已不再必要;另一方面,多次迭代往往只用于更新单个Token的表征。

相比之下,Mobius原生支持更为动态的隐空间推理机制。一方面,每一层都有机会访问全部知识,且不预先限定必须激活的知识,因此模型每经过一层都可以被视作完成一次隐空间推理,并通过更灵活的激活选择减少冗余计算。另一方面,Mobius在每一层迭代的不只是单个Token的表征,因此能够形成更高效的迭代过程,以及更连续、可微的优化路径。

面向递归自进化、AI辅助科学发现与世界模型

递归自进化、AI辅助科学发现和世界模型,正成为重要且亟待突破的前沿方向:

现阶段的递归自进化研究涵盖数据迭代、参数迭代、架构迭代等多种路径。无论采用何种方式,都需要构建高密度、高灵活性的记忆存储与拓展机制,以支持模型持续成长;

如果说Coding主要面向流程性问题,那么Research往往是流程、直觉与知识组合泛化的共同作用。要推动科学发现,需要让足以发掘“未知的已知”的关键知识既存储在模型中,又能在同一次推理过程中被有效激活;

语言模型主要建模离散Token,世界模型则需要建模连续的物理世界。现实世界具有丰富的波段与模态,因此,相较语言模型,世界模型对连续、可微的理解与推理机制提出了更高要求。

Mobius对知识存储与组合推理进行解耦,回应了递归自进化和科学发现对记忆机制、知识调用与组合泛化的核心需求,因此有望在这两个方向展现出不同于Transformer的架构潜力。其原生支持的隐空间推理机制的特性,也可能为世界模型的架构提供新的思路。与此同时,若要更充分地适配世界模型,Attention机制本身仍可能需要进一步调整,相关方向将在Mobius后续版本中持续探索。

为趋近Mobius的能力上限软硬协同设计已经在路上

现阶段,Mobius已展现出端到端推理效率优势,但这部分收益主要来自更高效的推理路径,以及由此形成的更短思维链(Chain-of-Thought,CoT)。若仅比较单个Token的推理效率,Mobius相较Transformer还有一点距离,主要源于Mobius架构在算法层面对知识与推理解耦的设计,该设计在硬件上表现为存储与计算的分离,对访存与通信提出更高需求,这也成为Mobius 进一步提升推理效率的主要阻碍。

在训练框架方面,基于上海AI实验室自研的Xtuner框架,实现了Mobius架构下的显存优化、数值一致性对齐、专家负载均衡以及RL全链路分析等相关优化。在推理优化上,上海AI实验室充分发挥自研LMDeploy框架的底层优势,从Kernel入手,针对2560 专家(MoE)的稀疏计算模式做了针对性优化。同时,借助 Mobius短思维链的特点,最终将整体推理效率提升至原来的数倍,大幅降低了延迟与算力成本。

目前,Mobius已经初步实现了在昇腾384超节点算力上的原生训练和推理,技术适配模块已完成开源发布。相较于其他GPU算力,昇腾384超节点对于多机通信有着更好的支持,显著契合Mobius架构对于更大通信带宽、更低通信时延的诉求。基于昇腾384超节点,上海AI实验室和昇腾的联创科研团队将进一步优化Mobius架构在Xtuner训练与LMDeploy推理框架下的运行表现,使其更亲和昇腾超节点算力架构,有望在未来激发出 Mobius更大的效率潜力。

打开网易新闻 查看精彩图片

昇腾384超节点上的测速结果,Mobius相对Transformer有明显提速