打开网易新闻 查看精彩图片

这项由普林斯顿大学与加州大学洛杉矶分校联合开展的研究,以预印本形式于2026年7月15日发布在arXiv平台,论文编号为arXiv:2607.13491。有兴趣深入了解的读者可以通过该编号查询完整论文。

**研究背景:深度是AI变聪明的关键,但代价太大**

你有没有想过,为什么现在的AI越来越厉害?其中一个重要原因是它们"想得越来越深"——也就是说,信息在模型内部经过的处理步骤越多,模型就越聪明。在AI领域,这叫做"深度"。

然而,问题来了:传统方法下,想让AI多"想"一步,就必须多塞一层新的神经网络结构进去,而每增加一层,模型存储和计算的代价就随之膨胀。这就像你想让一名厨师多做一道工序,就得另外再雇一名新厨师,整个厨房很快就会挤满了人,成本无法控制。

研究团队面对的核心挑战正是:能不能让同一批厨师反复工作多轮,而不是不断招募新人?这个思路在AI里被称为"循环Transformer"(Looped Transformer)——用少量固定的神经网络模块,反复运行多轮,从而在不增加存储参数的前提下,大幅提升模型的有效计算深度。

这个想法听起来很美,但实际操作时会遇到一个严重的稳定性危机。反复使用同一批参数,会导致训练过程中出现一种特殊的"共振效应"——梯度信号不断叠加放大,模型很容易训练崩溃,或者效果大打折扣。正是为了解决这个问题,研究团队提出了DeepLoop方法。

一、同一批厨师反复工作,会出什么问题?

以烹饪为核心比喻来理解整个研究:传统AI模型就像一家有很多个专属厨师的餐厅,每道菜(每一层数据处理)都有专人负责,不会交叉。而"循环Transformer"则像是一家只有少数几位厨师的小馆子,每位厨师需要把同样的工序重复做好几轮,才能完成一道复杂的菜肴。

具体来说,设有K个"物理模块"(相当于K位厨师),让他们循环工作R轮,那么总的有效处理深度就是N=K×R。存储的参数只有K个模块的量,但实际运行时的计算量相当于N层深度的模型。这就像两位厨师工作了三轮,等效于六道工序。

这听起来像是天上掉馅饼,但麻烦的地方在于:当同一位厨师(同一个参数模块)反复处理食材时,他每次操作留下的"手感记忆"(梯度信息)会叠加在一起,形成一个比普通情况下强得多的修正指令。而且,这个叠加后的指令还会在接下来的所有轮次里反复被执行。

用更技术性的语言来说:在普通的深层模型里,每一层参数只接收一次梯度更新,也只被读取一次;而在循环模型里,同一个参数的梯度来自R次访问的叠加,并在下一轮正向传播中被R次重复读取。这形成了"双重叠加"效应——写入多次,读取也多次,两者相乘,问题就会随R的增大急剧恶化。

研究团队将这种叠加效应的强度,用一个叫做"访问对齐系数"(κR)的数值来衡量。如果每轮操作的梯度方向彼此随机、互不相干(称为"去相关"情形),那么这些梯度在叠加时会部分抵消,κR约等于常数,问题不大。但如果每轮操作的梯度方向高度一致(称为"对齐"情形),那么它们会同向叠加,κR可以高达R倍,系统就会因为更新幅度过大而失稳。

二、前人的解法为什么不够用?

在这项研究之前,深度神经网络的训练稳定性问题已经有了一个经典解法,叫做DeepNorm(由微软研究院于2024年发表)。DeepNorm的核心思想是:在每个残差连接(可以理解为每个厨师的"快捷通道",让部分信息不经过处理直接跳过)上,乘以一个叫做α的比例因子;同时,在参数初始化时乘以一个叫做β的缩小系数

对于一个有N层的普通模型,DeepNorm选择α=(2N)^(1/4),β=(8N)^(-1/4)。这两个数字之间的比值β/α,决定了每次参数更新对最终输出的影响大小。DeepNorm的核心条件是:把所有层的影响加总起来(M乘以(β/α)?,其中M=2N是残差子层访问次数),结果应该是一个有限常数,不随深度增大而无限膨胀。

这套方法对普通深层模型非常有效,但它有一个隐含假设:每一层参数都是独立的,不会被重复使用。一旦引入参数共享(循环),这个假设就被打破了。

研究团队发现,对于循环模型,正确的稳定性条件不再是M×(β/α)?=O(1),而变成了M×κR×(β/α)?=O(1)。多出来的κR这一项,就是那个反映访问叠加效应的系数。在最坏情况下κR=Θ(R),条件就变成M×R×(β/α)?=O(1)。

把这个条件代入DeepNorm的参数形式α=(cN)^p,β=(dN)^(-p),就可以计算出:在固定物理深度K、不断增大循环轮数R的情形下,要让条件始终成立,指数p必须满足p≥1/2。而DeepNorm的p=1/4,在循环场景下远远不够。这相当于DeepNorm的稳定余量会随R线性增长,最终必然出问题。

三、DeepLoop:只改一个数字,稳定性大幅提升

既然问题的根源在于p=1/4不够大,解法就相当直接:把指数从1/4换成1/2,同时保留DeepNorm的其他一切设计不变。

这就是DeepLoop的全部内容。具体来说,对于一个有效深度为N的循环Transformer,DeepLoop将残差缩放系数设置为α=(2N)^(1/2),将参数初始化增益设置为β=(8N)^(-1/2)。其中系数(2,8)与DeepNorm保持一致,唯一改变的是指数从0.25变为0.50。

检验一下这个选择的效果:DeepLoop下β/α=1/(4N),代入最坏情形稳定条件:M×R×(β/α)?=2N×R×(1/16N?)=R/(8KN)=1/(8K?)。这是一个与循环轮数R完全无关的常数,只取决于物理模块数K。换句话说,无论R增大多少,稳定性条件始终满足,不会随着深度增加而恶化。

相比之下,如果用DeepNorm的p=1/4,这个值会随R线性增长,在R很大时必然超出控制。

从另一个角度看,DeepLoop的更新-残差比β/α从DeepNorm的1/(2√N)降低到了1/(4N),这意味着每次参数更新对输出的影响被压得更小,从而为多次叠加留出了足够的余量。代价是,在完全不使用循环(R=1)时,DeepLoop会稍微保守一些——但实验显示这个代价几乎可以忽略不计。

DeepLoop不引入任何额外的门控机制、不添加可学习的残差系数、不需要辅助损失函数,也不依赖特定架构的调参常数。它就是一行参数设置,对任何使用Post-LN(后归一化)架构的循环Transformer都可以直接套用。

四、用数学推导严格证明:什么时候需要p=1/2?

为了让这套逻辑更加严密,研究团队给出了完整的数学证明。核心结果是"指数阈值命题"(Proposition 3.2):

假设物理模块数K固定,有效深度N=K×R,访问对齐系数κR=Θ(R^γ),其中γ∈[0,1]。那么,对于参数族α=(cN)^p、β=(dN)^(-p),要让循环稳定性条件在R趋向无穷时始终成立,充要条件是p≥(1+γ)/4。

当γ=0时(访问完全去相关),阈值是p≥1/4,恰好等于DeepNorm的结论,说明DeepNorm在去相关情形下依然正确。当γ=1时(访问完全对齐,最坏情形),阈值是p≥1/2,即DeepLoop的选择。

这套推导建立在三个基础之上。首先是RMSNorm的局部线性展开(Lemma A.1):对于残差归一化层RMSNorm(αx+z),在残差分支输出z相比跳跃连接αx很小时,归一化后的输出中残差分支的贡献通过1/α进入,这就是为什么稳定条件里用β/α而不是β单独出现。其次是普通深层模型的DeepNorm界(Proposition A.2),它证明了M×(β/α)?=O(1)是非共享参数情形的充分条件。第三是循环模型的绑定扰动界(Proposition A.3),它通过对双重求和结构应用次乘性不等式,推导出M×κR×(β/α)?=O(1)的充分条件。

整个证明框架非常优雅:它没有改变任何底层假设,只是精确刻画了参数共享带来的额外聚合效应,并给出了应对这一效应的最小保守修正。

五、从单层循环到层次推理:DeepLoop的扩展应用

研究团队没有停留在简单的单层循环架构上,还把这套框架推广到了更复杂的"层次化循环推理器"。这类架构在最近的推理模型研究中出现频率很高,其代表是2025年发表的"层次推理模型"(HRM,Hierarchical Reasoning Model)。

层次化循环推理器的结构是:有一个高层模块H和一个低层模块L,在每个外循环周期C内,L先独立迭代CL次,然后H再更新一次。这就像一个主厨(H)和若干副厨(L)的分工——副厨在每道大菜里负责反复细磨工序,主厨只在每道菜完成后做一次总体调整。

这种架构还有一个关键特点:为了节省计算,训练时只对最后一个外循环的梯度进行反向传播,之前所有循环的状态都被"截断"处理(视为固定输入,不参与梯度计算)。这使得实际参与梯度计算的访问次数Mg远小于正向传播的总访问次数M。

研究团队证明,这种截断策略实际上把H模块自动放入了"去相关"安全区间:因为在可见梯度范围内,H模块每个物理子层只被访问一次(R_g^H=1),访问对齐系数自动折叠为常数,DeepNorm的p=1/4就足够了。

麻烦在于L模块:L的低层迭代CL次,如果这些迭代的梯度方向高度一致(而正是因为参数共享、每次执行相同操作,这种对齐是合理的预期),那么L模块就处于"对齐"情形,需要p≥1/2。一个统一的残差缩放指数必须满足最严格的那个模块,因此整个层次推理器同样需要p=1/2,与单模块循环backbone完全一致。

研究团队还指出了一个实践细节:层次推理器通常会在循环入口处添加一个可学习的任务嵌入向量,与词嵌入相加后送入循环。这个设计只影响正向传播信号的初始量级,不进入稳定性条件的推导,因此输入侧归一化和残差缩放规则可以作为独立的设计选择分别调整。

六、实验一:语言模型验证,循环越深优势越大

为了验证理论预测,研究团队在两个规模的GPT风格语言模型上进行了系统对比实验。

小规模实验使用GPT-2 small架构(约1.24亿参数,隐藏维度768,12层),中等规模使用GPT-2 medium架构(约3.5亿参数,隐藏维度1024,24层)。两者都在FineWeb-Edu数据集上训练500亿个token,总计10万个优化步骤,上下文长度1024。

对照设置非常干净:基线模型(base)和DeepLoop模型共享完全相同的循环backbone、优化器、数据流水线和随机种子;唯一的区别是,基线使用α=1、β=1(相当于没有任何残差缩放),而DeepLoop使用α=(2N)^(1/2)、β=(8N)^(-1/2)。实验分别在R=1、3、5、7四种循环轮数下运行。

结果完整地支持了理论预测。在R=1时(没有任何参数复用),两种方法的验证损失几乎完全一致:小规模下相差仅+0.0004 nats,中等规模下相差+0.0011 nats,差距小到可以忽略不计。这印证了理论的一个关键推论:当没有循环时,DeepLoop退化到与普通方案等价,不会带来额外代价。

从R=3开始,DeepLoop的优势开始显现并持续扩大。在小规模模型上,R=3时DeepLoop比基线低0.016 nats,R=5时达到最大差距0.023 nats,R=7时保持0.019 nats的优势。在中等规模模型上,差距随R单调递增,到R=7时达到0.028 nats。

两种方法在所有R值下都随循环轮数增加而持续改善,但DeepLoop在R≥3的所有情况下严格优于基线,且中等规模模型的改善幅度始终大于小规模模型,说明参数量更大时,正确的残差缩放对训练稳定性的帮助更为显著。

七、实验二:下游任务评测,七项任务中DeepLoop胜出

验证损失的改善是否真的能转化为实际能力的提升?研究团队在八个标准语言理解任务上进行了零样本和单样本评测,涵盖ARC-Challenge、ARC-Easy、HellaSwag、OpenBookQA、PIQA、SciQ、Social IQA和WinoGrande。

中等规模模型的评测结果非常清晰。在R=1时,两种方法的平均准确率几乎相同(零样本下50.86% vs 50.85%,单样本下51.69% vs 51.53%)。从R=3开始,DeepLoop在零样本平均分上领先0.43个百分点,在单样本上领先0.32个百分点。到R=7时,DeepLoop的零样本平均分达到53.88%,比基线的52.95%高出0.93个百分点;单样本平均分55.20%,比基线的54.62%高出0.58个百分点。

在单项任务层面,R=7时DeepLoop在8个任务中的7个(零样本和单样本两种设置下均如此)都超过了基线,唯一例外是PIQA。其中WinoGrande在零样本下的提升最为显眼:DeepLoop达到59.04%,而基线只有57.30%,相差1.74个百分点。SciQ在零样本下也有明显提升,从89.20%升至90.30%。

小规模模型的结果呈现了相同的质性规律:R=1时两者几乎一致,R=3和R=5时DeepLoop持续领先,小规模下最高1-shot平均分是DeepLoop R=5的49.66%,比同条件基线的49.16%高出0.50个百分点。

八、实验三:在ARC-AGI推理基准上,提升超过六个标准差

最引人注目的验证来自一个更具挑战性的推理任务。研究团队把DeepLoop的缩放规则应用到层次推理模型HRM上,并在ARC-AGI-1(一个专门用来测试人工智能抽象推理能力的基准,包含400道视觉推理谜题)上进行评测。

实验设置极为严格:基线使用原始发表的HRM架构和所有训练参数;DeepLoop版本唯一的改动就是把每个推理模块的残差缩放从默认值改为α=(2Ng)^(1/2)、β=(8Ng)^(-1/2),其中Ng=12是梯度可见的等效块深度。数据、优化器(AdamATan2)、训练周期(10万轮)、评测协议全部保持一致。

结果是:DeepLoop将"投票两次"的准确率(即每道题做两次预测,取一致结果为答案的协议,这是HRM论文的标准评测方式)从36.50%提升到39.75%,提升幅度3.25个百分点。通过四种随机种子的控制实验,研究团队确认单次种子的标准差约0.5个百分点,因此3.25个百分点的提升相当于约6个标准差的效应量,远非偶然的种子运气。

在不同投票预算下,DeepLoop也全面领先:单次预测准确率31.50% vs 35.50%(+4.00pp),投票10次下41.50% vs 44.25%(+2.75pp),投票100次下47.50% vs 49.75%(+2.25pp),投票1000次下50.75% vs 51.50%(+0.75pp)。随着投票次数增加,两者的差距有所收窄,这符合大数定律的预期——更多次数的平均会趋向各自的真实水平。

这个结果有力地证明了理论对层次推理架构的预测:当模型的有效深度通过对齐的内层循环实现时,p=1/2的残差缩放指数是必要的,不是可选的优化。

九、从公式到直觉:这套理论的完整图景

把所有内容串联起来,研究团队描绘了一幅完整的图景。

残差缩放的本质是控制"每次参数更新对输出的影响强度"。在普通深层模型里,M次残差访问各自独立,总影响是M个独立小量的加总,要让总量有界,每个小量的量级就应该是1/M量级,这给出了β/α~1/√M,对应DeepNorm的p=1/4。

在循环模型里,由于参数共享,R次访问实际上共用同一个更新量,该更新量由R次梯度叠加而成,并被R次正向传播读取。最坏情形下,这创造了一个R×R=R?的放大因子,而总访问次数M=K×R已经包含了一个R,因此额外的"非独立"因子是R(从MκR与M的比值来看)。要抵消这额外的R倍放大,就需要把每次访问的影响强度再压低一个√R倍,由于N=KR,√R~√N,这正好把p从1/4推高到1/2。

研究团队还通过"访问对齐系数"κR统一了两种极端情形:κR=O(1)时退化到DeepNorm,κR=Θ(R)时要求p=1/2,而中间情形κR=Θ(R^γ)对应p≥(1+γ)/4。这个统一框架既保留了对已有工作的兼容,又给出了循环特定情形的精确修正。

重要的是,研究团队明确指出,DeepLoop的p=1/2不是说每个实际循环模型都会达到最坏情形的对齐。这是一个"保守"的保证:只要系统设计者无法排除对齐的可能,就应该使用p=1/2来确保无论实际对齐程度如何都不会出现稳定性问题。如果未来有办法直接测量或控制访问对齐程度,就可能使用更激进的小指数来获得更快的学习速度。

十、附录实验:p=1/2是一个真实的相变边界

为了进一步验证理论预测的精确性,研究团队做了一个精巧的消融实验:固定循环轮数R=3,在GPT-2 small架构上扫描指数p从0.30到0.60的七个值(步长0.05),每个值运行最多五个随机种子,观察训练是否能正常收敛。

实验结果呈现出一个非常清晰的相变现象。p=0.30、0.35、0.40的全部种子都完全无法离开"单字频率基准线"——这是一种退化的失败状态,模型只会输出最常见词,完全没有学到任何有意义的语言规律。p=0.45是边界区域,部分种子成功训练,部分失败。p=0.50及以上则所有种子都能稳定训练。

在成功训练的种子中,验证损失随p的增大而略有上升(p=0.45时3.70,p=0.50时3.73,p=0.55时3.76,p=0.60时3.80),这说明指数越大、学习信号越保守,短期内收敛速度稍慢。正因为如此,p=1/2既是理论预测的阈值,也恰好是实验中找到的"最小可靠稳定指数"——更小的值有更快的学习潜力,但没有足够的稳定性保障;更大的值更安全,但损失了部分学习效率。

这个相变边界与Proposition 3.2的理论预测吻合得出奇地好,为整套理论框架提供了直接的经验支撑。

归根结底,这项研究回答的是一个非常具体但影响深远的问题:当AI模型通过反复使用同一批参数来"思考更多轮"时,应该怎样调整它的初始化和残差连接系数,才能保证训练过程稳定、有效?

答案是:把DeepNorm的残差缩放指数从1/4提升到1/2。这个改动用一行公式α=(2N)^(1/2)、β=(8N)^(-1/2)就能完成,不需要任何额外组件。它背后的逻辑是:参数被重复访问的次数越多,每次访问对训练稳定性的潜在影响就越大,需要更保守的初始化来维持平衡。

对于普通用户来说,这意味着未来的AI模型可以在不大幅增加存储参数的前提下,通过增加"思考轮数"来变得更聪明、更擅长推理,而不必担心训练崩溃。在ARC-AGI这类需要抽象推理能力的任务上,3.25个百分点的提升(约6个标准差效应量)已经展示了这套方案的实际价值。

更进一步的研究空间依然宽广:研究团队建议未来工作可以直接测量真实训练过程中访问对齐系数κR的量级,看看实际系统离最坏情形有多近;也可以探索是否能通过训练技巧主动促进访问去相关,从而安全使用更激进的小指数;还可以测试这套规则在更大规模、更长训练时间、不同归一化方式下的普适性。有兴趣深入了解的读者可以通过arXiv:2607.13491查阅完整论文和代码(项目代码托管于github.com/lszshu/DeepLoop)。

Q&A

Q1:DeepLoop和DeepNorm有什么区别,能直接替换吗?

A:DeepLoop是DeepNorm针对循环Transformer的修正版本。两者架构完全相同(都是Post-LN残差结构),区别只在于残差缩放指数:DeepNorm用p=1/4,DeepLoop用p=1/2,即α=(2N)^(1/2)、β=(8N)^(-1/2)。对于普通不共享参数的模型,两种方法效果相当;只有当同一参数模块被循环复用时,DeepLoop的优势才会体现。可以直接将循环模型的残差参数替换为DeepLoop的公式,无需任何其他改动。

Q2:循环Transformer在实际应用中会更省资源吗?

A:参数存储上会省资源——只需存储K个物理模块,不需要存储N=K×R个独立模块。但运行时计算量并不减少,因为模块仍然要执行R轮。实际上,循环Transformer的设计目标不是省算力,而是用相同参数量实现更深的"有效计算深度",相当于在固定参数预算下提升推理质量,适合对参数大小有限制但对计算资源相对宽裕的应用场景。

Q3:DeepLoop在R=1时会不会拖累模型性能?

A:实验结果显示几乎没有影响。在两个规模(GPT-2 small和medium)的测试中,R=1时DeepLoop与基线的验证损失差距分别只有+0.0004和+0.0011 nats,属于随机波动范围内。下游任务的平均准确率差距也在0.2个百分点以内。这说明p=1/2的更保守初始化在单轮无复用场景下几乎不带来代价,可以作为循环Transformer的安全默认设置。