参数越堆越大这条路,可能要被绕开了。据称GPT-6 Astra采用循环变换器,做法不是继续加参数量,而是让模型多次经过同一批层。
同一批层,反复走几遍
打开网易新闻 查看精彩图片
循环变换器的思路,是把计算深度和模型规模拆开看。参数不增,模型却能在同一组层里多跑几轮,用重复计算换更深的处理能力。
这跟过去几年"参数越大越强"的直觉不太一样。规模不再是唯一变量,深度成了另一个可调的方向。
为什么这个选择值得琢磨
SemiAnalysis认为,实验室最清楚模型扩展方向,这一选择暗示他们在路线图和研究中对参数规模的扩展预期已不再激进。
换句话说,连最了解内情的一方,都在把注意力从"加参数"挪开。至于这条路最终能走多远,目前只有方向,没有答案。
热门跟贴