报告来源:浙商证券
报告主题:RSI / Recursive Self-Improvement / Latent Reasoning / Recurrent Depth / AI研发 / 算力需求
研究市场/地区:全球前沿大模型及AI算力产业链
发布时间:2026年9月14日
速读整理:洞见研报
一句话速读
浙商证券认为,上一轮AI应用收入爆发的核心,是模型能力跨过了Coding等场景的“可交付门槛”,下一轮增量同样要从模型能力突破寻找答案。报告重点关注两条潜在技术路径:一是RSI,即AI参与自身研发,通过提高研发效率或模型能力反哺下一轮研发;二是Latent Reasoning / Recurrent Depth,即不依赖生成更多显式推理Token,而是在潜在空间中反复计算,提高单Token内部计算深度。当前,RSI在代码优化、实验执行等“效率改进”环节已经出现明显兑现,但真正涉及研究判断和自主议程的能力尚未跨过分水岭;Latent Scaling则已从学术研究走向前沿模型尝试。若两条路线持续推进,研发端实验数量和大规模验证次数可能同步增加,应用端则可能通过成本下降和能力提升共同扩大需求,最终使AI算力增长从“模型训练+推理”进一步延伸到“AI研发自身消耗”。
核心看点
第一,RSI并不是AI自动写代码,而是AI研发成果能够进一步提升下一轮AI研发的能力或效率。 当前执行自动化已经较成熟,但真正关键的Design与Decide仍主要由人完成。
第二,AI研发的算力大头并不一定在最终训练,而在大量搜索和验证实验。 报告引用案例显示,设计和超参数搜索可占研发算力消耗的75%,最终训练仅占3.7%。
第三,RSI若突破,会同时增加“候选实验数量”和“高成本大模型验证比例”。 一个让前端实验更多,一个让更多实验走到后端大规模验证,都会推高研发算力。
第四,Latent Scaling可能形成新的Scaling方向。 相比CoT通过生成更多Token增加算力,
Recurrent Depth通过提高FLOPs/Token增加计算深度,因此报告判断其边际增量更偏向计算侧,HBM容量增幅可能低于算力增幅。
一、模型能力突破,仍是下一轮AI收入扩张的核心变量
报告首先回到一个非常关键的产业逻辑。
上一轮大模型商业化为什么突然加速,并不只是因为模型更便宜,也不只是因为算力更多,而是模型能力终于跨过了部分应用场景的可交付门槛。
Coding就是最典型的例子。
当模型能够稳定承担代码生成、修改、调试等任务后,AI从“能演示”进入“能交付”,应用收入和推理需求随即快速释放。
报告据此提出,下一轮AI ARR增长的核心变量,同样应该从模型能力继续突破寻找。
截至报告引用数据,Anthropic 2026年7月ARR已超过650亿美元,OpenAI 2026年8月ARR超过400亿美元。
在此背景下,RSI与Latent Reasoning被报告视为下一轮模型能力提升值得重点跟踪的两条路线。
真正决定下一轮应用空间能否打开的,不是模型再多几个参数,而是模型能不能跨过更多任务的“可交付线”。
二、什么是RSI:让AI参与“造下一代AI”
RSI全称Recursive Self-Improvement,即递归自我改进。
报告给出的定义并不等同于“AI自己训练自己”。
更准确地说,RSI指的是AI参与模型研发,并通过研发成果提高模型能力或研发效率,再进一步提高下一轮研发生产率。
传统研发是“Human R&D—新模型”。
而RSI路径中,AI会越来越多参与研发过程,例如辅助代码编写、运行实验、分析结果、提出改进,再由改进后的模型继续参与下一轮研发。
报告强调,一个关键判据是:
研发结果是否真正提升下一轮研发能力或效率,而不仅仅是完成当前任务。
只要形成“AI参与研发—能力或效率提升—下一轮研发更快”的反馈闭环,就属于广义RSI。
三、RSI已经开始落地,但目前更多发生在“效率侧”
目前AI进入研发主要有两条路径。
第一条是优化代码、算子和系统流程,降低执行成本。
这部分已经出现明显进展。
报告引用Anthropic内部测试称,其模型会自主优化一段用于训练小型AI模型的代码,在保持正确性的前提下反复改写、运行和计时。
2025年5月Opus 4可实现约3倍加速,到2026年4月Mythos Preview已经达到约52倍加速。
相比之下,熟练人类研究员4—8小时的优化成果约为4倍。
报告还提到,在真实训练故障排查中,Claude约2小时即可定位问题、完成复现并确认修复,而人工通常需要2—3天。
这意味着,AI作为研发工程助手已经不只是概念,部分效率提升已经进入生产环境。
四、真正难的是“能力侧”:AI能不能自己做研究判断
RSI的第二条路径,比单纯提高效率更难。
它要求AI不只是执行任务,而是自主提出假设、设计实验、判断结果,再决定下一步研究方向。
Microsoft Research Arbor已经展示出一定可能性。
在给定研究目标和评估器后,AI可以自主完成“提出假设—执行实验—读取结果—保留或淘汰方向—继续搜索”的循环,并在6项真实研究任务中取得较好的held-out结果。
但报告认为,这类能力目前仍处于实验室和有界问题阶段。
真正的前沿模型研发,关键决策权仍主要掌握在人类研究员手中。
RSI当前的状态更接近“AI研究助理”,还不是能够独立决定研究议程的“AI科学家”。
五、RSI真正的分水岭,是Design和Decide
报告将研究工作拆分为Build、Run、Analyze、Design、Decide等不同任务。
目前AI进步最明显的是前三类:
- 代码与数据准备、实验运行,以及结果分析。
- 但真正区分“辅助研究”和“自主研究”的,是后两类。
- Design对应研究设计,Decide则对应下一步研究决策。
OpenAI的实际数据也显示,目前AI在研发中的增长主要集中在代码、技术支持和运行监控等执行任务,高层研究规划仍然占比较低。
因此,报告认为,AI要从执行自动化进入闭环自主,再进一步走向议程自主,关键并不是它能做更多实验,而是它能否独立回答两个问题:
什么值得研究,以及实验结果出来后,下一步到底该往哪里走。
六、自主研究还没有真正跨过分水岭
报告进一步给出了判断RSI是否真正突破的几个标准。
- 第一是Research Taste,也就是判断哪些问题和假设值得投入。
- 第二是Evaluation & Verification,即判断实验结果是否可靠、方向是否值得继续。
- 第三是Long-horizon State,也就是能够跨越多轮实验保存和调用研究记录,长期推进一个问题。
公开评测显示,这三项能力目前都还不稳定。
报告引用AutoResearchEval数据,该评测覆盖100个前沿科学任务和800条完整自主研究轨迹。
不同模型的共同问题集中在:难以稳定检查自己的结论是否有证据支持,发现问题后不一定主动修正,也难以重新判断原有研究路径是否合理。
这意味着,AI虽然能完成越来越复杂的研究任务,但距离真正“自己判断研究方向”还有明显距离。
七、OpenAI和Anthropic都还没有触发真正的RSI门槛报告还梳理了头部实验室自己设定的标准。
OpenAI在Preparedness框架中,将更高等级的AI研发能力定义为:能够为每位研究人员提供高水平、职业中期研究工程师级辅助。
更高一级则要求出现超人类研究科学家Agent,或者能够把同等代际模型进步所需时间压缩到2024年水平的五分之一,并持续数月。
报告指出,当前GPT-6 Astra仍低于AI Self-improvement High标准。
Anthropic的标准则包括:AI能够以不超过人类5倍的成本完全替代研究科学家和工程师,或者AI研发自动化能够让整体能力进步速度达到基线的2倍。
截至2026年7月15日,两项条件均未触发。
因此,目前行业尚未进入真正意义上的“AI自主研发加速期”。
八、另一个难点:小模型上有效,不代表大模型上也有效
RSI不仅要解决自主决策,还面临一个更实际的问题——研究成果能不能迁移到前沿模型。
报告将验证过程划分为三个层级。
- 有界研究,只需要在明确问题和评测环境中成立。
- 多规模研究,则要求同一个结论在多个模型规模上依然有效。
- 真正的核心模型研发,则必须在目标大模型上成立,并进入正式训练流程。
问题在于,小规模实验结果可能在大规模上发生反转。
报告引用Microsoft AI案例指出,在约5B规模上,某种STEM密集数据配方表现更好,但当模型推到23B激活参数、约20T Tokens后,代码密集配方反而胜出。
而且这种反转需要训练过半后才稳定出现。
这说明,小模型实验可能给出完全错误的方向。
AI提出改进很快,但如果每一个结论都必须重新在大模型上确认,真正的研发瓶颈就会从“想不到”变成“验证不起”。
九、RSI真正突破的信号,是AI找到的改进能进入核心模型
报告认为,未来最值得关注的不是AI能做多少小实验,而是AI自己发现的改进,能不能一路完成规模化验证并真正进入下一代前沿模型。
目前已有一些初步进展。
例如跨规模超参数迁移方法,已经能够让部分小规模结果更可靠,并进入155B总参数、17B激活参数MoE模型的正式预训练。
但对于复杂系统级改进,目前仍然缺乏捷径,只能回到完整模型流程中端到端验证。
Anthropic曾把AI研究系统发现的一种标签修正方法迁移至Sonnet 4.0生产环境,但最终在偏好任务留出集上的最佳提升只有约0.5点,仍处于噪声区间。
因此,真正值得跟踪的是“AI发现—大规模验证—正式采用”这条链路是否能够跑通。
一旦跑通,AI迭代速度可能从人力约束转向算力约束。
十、RSI首先改变的,是AI研发算力
很多市场讨论RSI时,更关注最终应用需求。
但浙商证券认为,RSI最直接影响的其实是研发算力。
AI算力可以大致分为模型研发和模型应用两部分。
研发内部又可以继续拆分成搜索Search和模型生产Production。
Production是配方基本确定后的正式预训练、中训练和后训练。
Search则是模型最终定型之前,不断通过实验寻找数据配方、模型结构、超参数和算法改进的过程。
RSI首先进入的就是Search。
报告给出的一个重要数据是:2026年8月中旬,OpenAI研究组织中,AI Agent累计运行时长按工作日折算,已经达到研究人员工作时长的约3.1倍。
而2026年6月以前,这一比例仍低于1倍。
这说明AI研发Agent使用强度正在快速提升。
十一、模型研发最耗算力的,不一定是最后一次训练
这是报告中很重要的一个判断。
直觉上,人们容易认为,训练一个最终大模型才是研发中最耗算力的环节。
但实际研发过程需要先跑大量实验。
Microsoft在MAI-Thinking-1的数据配方研究中,为确定最终预训练配方,训练了183个模型。
61种候选配方分别在3个规模上训练一次。
此外,还额外训练了数千个760M—4B激活参数的小模型。
另一个案例中,Kyutai Moshi研发日志显示,设计与超参数调优占整体研发算力消耗的75%,消融和安全分析占8%,调试和失败运行合计超过13%,而最终训练只占3.7%。
真正昂贵的,不只是造出最终模型,而是找到“该怎么造”这件事本身。
十二、RSI突破会让搜索实验数量进一步膨胀
模型研发搜索本质上是一种逐级筛选。
先在小模型上测试大量假设,淘汰大部分方向。
通过的候选进入更大模型复验,再进一步筛选。
最后只有极少数候选进入接近目标模型规模的高成本验证。
因此,搜索算力可以理解为:
每一级实验数量 × 单次实验成本,再把所有层级相加。
RSI可能同时改变两个变量。
如果AI拥有更强研究决策能力,就能提出更多实验假设,第一层候选数量会快速增加。
如果AI发现的改进更容易跨规模成立,那么更多候选会进入后端的大模型验证阶段。
前者增加实验数量,后者增加高成本实验比例,两条路径都会推高研发算力。
十三、算力消耗最集中的,反而是搜索漏斗后端
搜索流程还有一个重要特点:
实验数量通常集中在前端,但算力消耗集中在后端。
原因很简单。
小模型实验数量虽然很多,但单次成本较低。
越接近目标模型,模型越大、训练时间越长,单次验证成本呈数量级提升。
报告引用Moshi项目数据称,约13%的运行消耗了接近89%的GPU时间。
因此,如果RSI只是让前端候选增多,算力会增加。
但如果RSI进一步提高候选通过率,让更多方向走到大规模验证阶段,算力增长会更加明显。
真正值得关注的不是AI做了多少实验,而是多少实验开始进入“大模型级别的昂贵验证”。
十四、RSI对应用端算力,还有“杰文斯效应”
RSI如果提高算法效率,看起来似乎意味着同一任务需要更少算力。
但报告认为,历史经验恰恰相反。
效率提升往往导致单位使用成本下降,最终使用量大幅增长,也就是典型的杰文斯效应。
报告举例称,2025年1月DeepSeek发布后,市场一度按照“高效率会降低算力需求”进行定价,但随后两个月H100云服务价格反而上涨约22%,背后正是推理需求快速释放。
类似现象也出现在训练和推理两侧。
训练侧效率提升约3倍/年,但算力投入仍以更快速度增长;推理价格显著下降的同时,企业AI预算仍大幅提升。
因此,模型更省算力,不代表行业总算力下降,反而可能因为使用量快速增加而推高总需求。
十五、真正更大的增量,来自更多应用跨过可交付门槛
相比成本下降,报告更看重能力提升带来的需求扩张。
如果模型能力突破后,可以承担过去无法稳定完成的任务,就会直接打开新的应用市场。
上一轮Coding已经验证了这一逻辑。
当模型从辅助写代码走向能够完成更完整的软件开发任务后,AI Coding收入快速增长,并进一步推动推理算力需求。
RSI如果使模型能力迭代加快,就可能让法律、科研、金融、复杂Agent任务等更多场景进入可交付区间。
一旦新的应用形成规模化ARR,算力需求也会随之增长。
所以RSI对算力的真正弹性,不只是让现有任务跑得更多,而是让AI突然能做过去做不了的事情。
十六、Latent Reasoning提供了另一条Scaling路径
除了RSI,报告重点研究了Latent Reasoning,也称Recurrent Depth。
过去大模型扩展能力主要依靠两条路径。
第一条是Parameter Scaling,也就是增加参数规模。
第二条是CoT Scaling,即让模型生成更多推理Token,“想得更长”。
Latent Scaling则提供了第三种方式。
它不一定增加参数数量,也不一定生成更长的显式推理链,而是在潜在空间内部,让同一组
Transformer层反复运行多轮。
报告将其概括为:
CoT是“想得更长”,Latent Reasoning则是“每一个Token想得更深”。
十七、8层模型,可以形成132层有效计算深度
报告给出了一个非常直观的结构例子。
假设模型包含2层Prelude、4层Recurrent Core和2层Coda,真实网络只有8层。
如果Core循环32次,那么有效计算深度就是:
2 + 4 × 32 + 2 = 132层。
也就是说,不需要把模型参数真正扩展到132层,也可以通过重复使用同一组Core参数,让每个Token经历更加深度的计算。
报告引用研究结果称,约3.5B参数的Recurrent Depth模型,其训练FLOPs已经可以接近32B固定深度Transformer。
模型参数没有同比增加,但计算量可以大幅增加,这正是Latent Scaling的核心。
十八、Latent Scaling与CoT Scaling,对硬件需求并不一样
CoT Scaling通过生成更多Token提高推理能力。
Token越多,上下文越长,KV Cache和显存需求也会同步增加。
Latent Scaling则主要增加每个Token内部的循环次数。
由于同一组权重可以反复复用,权重存储并不会随着有效计算深度同比增加。
同时,不同循环可以共享固定KV Cache Budget,也不需要持续扩大显式Context。
因此,报告判断:
Latent Scaling带来的算力增量可能明显大于HBM容量增量。
这并不是说HBM需求会下降。
而是说相较于传统CoT Scaling,新增需求结构可能更加偏向计算侧。
十九、Recurrent Depth已经从论文走向前沿模型探索
报告引用媒体报道指出,OpenAI Astra已经采用Recurrent Depth或Looped Transformer形式的架构。
这一技术路线与公开的Latent Reasoning研究相似。
目前公开信息仍然有限,具体循环次数、覆盖范围和硬件实现尚未完全披露。
OpenAI对使用强度也保持一定限制,部分原因来自可监控性问题。
更多计算发生在Latent Space内部后,显式可读的CoT减少,安全团队更难直接观察模型内部推理过程。
官方评测显示,Astra的monitorability低于GPT-5.6 Sol。
因此,下一阶段需要关注的已经不是“有没有采用Recurrent Depth”,而是:
到底循环多深、覆盖多少任务,以及在安全约束下能不能继续提高使用强度。
二十、Latent Scaling若持续加强,新增需求可能更偏向计算芯片
从产业链角度看,Latent Scaling最大的变化在于资源结构。
传统CoT Scaling增加Reasoning Token,使计算量和显存、KV Cache需求一起提升。
Latent Scaling则更多体现为FLOPs/Token上升。
循环越深,同一个Token需要执行的矩阵计算越多,但权重和KV Cache能够重复使用。
因此报告判断,如果Latent Scaling成为未来主要Scaling路线之一,新增需求可能更多落在算力芯片,而HBM容量需求的边际增幅相对较低。
需要注意的是,这里讨论的是结构占比。
如果RSI和AI应用总体需求继续扩大,HBM绝对需求仍然可能继续增长。
只是相对于算力需求,增幅可能没有计算侧那么高。
二十一、模型竞争可能重新回到架构与训练能力
过去一段时间,模型蒸馏是追赶前沿模型的重要方式。
原因在于,显式CoT会把推理过程直接输出为Token。
追赶者可以学习这些输出,用较低成本复制头部模型的部分能力。
但RSI和Latent Scaling可能削弱这种路径。
Latent Scaling的核心能力发生在模型架构内部,从预训练阶段就需要学习,单纯观察输出并不能复制内部循环结构。
RSI形成的研发效率优势,更不会出现在某一次模型输出中。
因此,报告认为,未来模型竞争可能重新回到持续研发能力。
领先者的优势不再只是“这一代模型强多少”,而是“能不能更快产生下一代模型”。
二十二、追赶者也可能因此增加研发算力投入
如果蒸馏越来越难快速缩小差距,追赶者就必须建设自己的研发体系。
这意味着,不只是头部模型厂商需要增加研发算力。
第二梯队和追赶型厂商也可能同步提高基础研究、实验搜索和大规模验证投入。
报告由此提出一个重要产业含义:
当模型差距更难通过简单蒸馏复制时,研发速度本身会成为护城河,而整个行业的研发算力竞争可能进一步加剧。
二十三、安全约束正在成为Scaling的新变量
模型能力加速并不意味着可以无限扩张。
报告特别关注了安全和可监控性的影响。
RSI的风险在于,模型能力进步速度可能逐步超过人类理解和安全机制跟进速度。
Latent Scaling的问题则在于更多推理进入潜在空间后,CoT可监控性降低。
2026年9月,多家前沿实验室开始更加公开讨论“Scaling必须与安全能力同步”。
报告援引OpenAI与Anthropic相关表态,认为未来安全检测、隔离、监控和外部评估可能直接影响模型研发和发布节奏。
因此,算力扩张并不只受技术和资本约束,安全信心也可能成为新的上限。
二十四、报告最终指向的核心,是AI上游“量”的需求
综合RSI和Latent Reasoning两条路线,报告的核心产业判断非常明确。
RSI如果突破,会从研发端提高实验数量和大模型验证次数,同时从应用端通过效率下降成本、能力提升打开新场景。
Latent Scaling如果成为重要Scaling方向,则会进一步提高FLOPs/Token。
两者共同作用下,AI产业的算力需求不再只来自“训练更大的模型”和“更多用户推理”。
还会新增一层:
AI自己研发下一代AI,本身也开始变成一个越来越大的算力消费者。
这也是报告认为未来算力需求仍具备进一步上修空间的核心原因。
洞见研报观点
这篇报告最值得关注的,并不是RSI是不是马上会出现“自我进化AI”,而是它重新定义了未来AI算力增长来自哪里。
第一,研发算力可能从过去相对隐性的成本项,变成下一阶段的重要需求来源。 当Agent越来越多参与实验搜索,大量小模型实验和大模型验证本身就会持续消耗GPU资源。
第二,真正需要跟踪的RSI信号,不是AI写代码有多快,而是研究决策权有没有发生转移。 Design、Decide以及研究结论能否进入核心模型,比单纯执行自动化更关键。
第三,模型能力提升仍然可能产生强烈的杰文斯效应。 即使单位推理成本继续下降,只要价格下降带来的调用量增长更快,总算力需求仍然会上升。
第四,Latent Scaling可能改变AI硬件需求结构。 如果更多推理计算从显式Token转向潜在空间内部循环,未来新增需求可能更加偏向FLOPs,而不是同比例增加HBM容量。
第五,前沿模型竞争可能重新强化“原创研发”的价值。 当蒸馏越来越难复制内部架构和研发体系优势,持续投入算力、训练方法和系统研发的重要性会进一步提升。
结论
浙商证券这篇报告的核心判断可以概括为:下一轮AI产业扩张的关键变量,可能不再只是参数规模和CoT长度,而是AI能否真正参与自身研发,以及模型能否通过新的内部计算方式继续Scaling。
RSI方面,当前AI已经能够明显提高代码优化、运行实验和故障排查效率,部分场景中的加速效果甚至达到数十倍。
但真正的自主研究仍然没有跨过分水岭。
AI是否能够独立完成研究设计、结果验证和方向选择,以及AI自己找到的改进能否迁移到大规模核心模型,仍是下一阶段最重要的验证点。
一旦这一循环跑通,模型研发可能从“人提出有限假设、AI辅助验证”,转向“AI大量提出假设、算力负责筛选”,研发瓶颈也会从人力逐步转向算力。
Latent Reasoning方面,Recurrent Depth提供了一条不同于参数扩张和显式CoT的新Scaling路径。
通过在潜在空间内部反复计算,同一组参数可以获得更高有效计算深度,从而显著提高
FLOPs/Token。
报告据此判断,如果这一技术路线进一步强化,算力需求增长可能快于HBM容量需求增长,新增硬件需求结构更偏向计算侧。
整体来看,RSI解决的是“AI能不能更快地产生下一代能力”,Latent Reasoning解决的是“单个Token还能不能继续增加计算深度”。
两者若同时取得突破,AI算力需求就可能从训练、推理继续扩展到研发自循环、更多应用场景以及更高单Token计算量,成为下一阶段算力再扩容的重要潜在驱动力。
关于研报速读
“研报速读”由洞见研报整理发布,聚焦全球主流机构报告、行业研究与前沿趋势内容,提炼核心观点、关键数据与商业启发,帮助读者快速理解报告价值。
免责声明
本文为洞见研报基于已有报告进行的学习型整理与观点提炼,不构成投资建议、商业决策建议或对原报告的完整替代。原报告版权归原发布机构及相关权利方所有,如需完整内容,请以原报告为准。
洞见研报
让复杂报告更快被读懂。
热门跟贴