Chimera是一个架构研究项目,并非已发布的产品。达尔文系列模型是在共享Transformer骨架的不同模型之间进行合并,而Chimera走得更远——它尝试将异构架构进行交叉融合,例如把变换器与曼巴风格的状态空间层结合起来。

这么做的动机在于,不同架构的失效模式各不相同:注意力机制能捕捉长程结构,但计算复杂度是二次方的,而且可能自信地产生幻觉;状态空间模型具有线性时间复杂度,在处理长序列时表现稳定,但在某些检索模式上表现较弱。把它们组合在一起,就是试图在一个网络中保留两种架构的互补优势。

打开网易新闻 查看精彩图片

在推进跨架构研究的同时,团队还开发了一条名为Oheng的内部注意力技术路线,这个名称源自韩语中“五行”的说法。Oheng是一种五路注意力设计,通过对多种注意力行为进行路由或组合来增强鲁棒性并抑制幻觉,而不是依赖单一机制。坦率地讲,这是一个关于注意力多样性的结构化研究赌注,并非一个在公开排行榜上验证过的成熟模块。

让不同架构杂交并非没有代价。变换器模块和状态空间模块拥有不同的归纳偏置、不同的记忆动态以及不同的训练稳定性特征。简单堆叠往往导致效果不如任一原始架构。具体的研究问题包括:相对于注意力层,状态空间层应该放置在什么位置;残差流是该共享还是分开;应该采用怎样的初始化方式,才能在训练早期不让某一分支主导学习过程。这些都是开放性问题,而Chimera的定位就是一个研究这些问题的实验平台,并非一套已经定型的方案。

无论是混合架构还是Oheng注意力线,其公开宣称的目标都是提升鲁棒性,包括降低幻觉。这一假设有其合理性:将多种不同的注意力或序列混合行为进行集成,有可能降低单一失效模式不受抑制地蔓延的风险。但鲁棒性声明只有在可衡量的前提下才有意义,目前这项工作仍处于架构探索阶段。任何单项基准测试的数字都不应被解读为最终结论。

最好将Chimera理解为支撑未来模型系列的上游研究。达尔文项目证明了对同构模型进行合并是可行的;AETHER项目证明了在这种模型规模下,从零开始构建一个完全开放的模型是可以做到的。而Chimera提出了一个更艰难、时间跨度更长的命题:将根本不同的序列建模原语结合在一起,是否能产生既高效又更难被欺骗的模型。

这项工作尚处在早期阶段,它本来就应该如此。

Chimera处于研究阶段。这里没有任何关于发布产品、基准测试成绩或达到当前最优结果的声明。变换器与曼巴的混合架构以及五路Oheng注意力线,都是面向鲁棒性和幻觉抑制的架构实验;它们在规模上能否击败强大的变换器基线,恰恰是这个研究项目所要回答的开放性问题。应该把这篇描述理解为一个研究方向及其设计理由的说明,而非经过验证的结论。