DeepMind 又对 Transformer 架构动刀了。这次提出的 回流机制,思路很直接:不改动任何权重,让深层激活回流到浅层,重新参与计算。
实验结果显示,这一机制能显著提升语言建模性能。在特定设置下,仅用一个小模块就能反超全量微调的效果。
打开网易新闻 查看精彩图片
核心思路:激活回流
传统 Transformer 的信息流是单向的,深层只能消费浅层传来的信息。回流机制打破了这一路径,将深层的激活值重新注入浅层,相当于给网络增加了一条“回头路”。
关键在于,这条回流路径不涉及权重更新。也就是说,模型参数保持不变,纯粹通过改变激活的流动方式来提升表现。
小模块为何能反超?
全量微调需要更新所有参数,成本高且可能破坏预训练知识。回流机制提供了一种轻量替代方案:只训练一个负责回流的小模块,就能达到甚至超过全量微调的效果。
这一结果对参数高效微调(PEFT)领域是个有力补充,也暗示着 Transformer 的信息流设计仍有不小的优化空间。
热门跟贴