他拥有创始人独有的影响力,直接插手芯片分配,给Gemini团队开辟特殊算力通道,砍掉优先级不符的芯片项目,甚至收集员工编码数据,用来训练模型代码能力。内部员工评价布林,已经彻底信奉AGI,把RSI当成谷歌翻盘的唯一机会。路透社在8月就报道,布林在全员会议上催促团队,把资源全面倾斜到自我改进方向。
最近AI圈炸出一桩悬案:一张API截图、一句藏头诗、一批紧急收回的密钥,所有人都在问同一个问题——谷歌DeepMind是不是已经跑通了传说中的RSI递归自我改进?
这个概念在学术界讨论了二十年,简单来说,就是AI不再单纯等着人类投喂数据、人工评估效果,而是可以自己评估、迭代、训练下一代更强模型。一旦这套闭环跑通,AI研发的节奏会从按季度更新,压缩到以周甚至天为单位。
截图的真假至今没有第三方实锤,谷歌全程沉默。但巧合的是,另一边Anthropic的CEO公开表态,RSI已经在整个行业发生,连自家内部也出现了这类现象。再加上谷歌近期反常的模型迭代速度,很难不让人猜测,AI竞赛的底层规则,正在发生改变。
一、藏头诗与API截图,一场突如其来的泄密风波
整件事的导火索,始于9月11日X平台上一条不起眼的祝贺帖子。账号lyra发文向DeepMind道贺,句子里刻意大写的三个字母拼在一起,刚好是RSI。
这条帖子很快引爆评论区,不少圈内人开始寻找线索。没过多久,另一位网友放出一张API返回截图,JSON信息里出现了`rsi-model-liverl-le`这个内部模型名称,标注为RSIModelLiveRLLE。配套参数写着1048576输入token上限,输出最高65536token,和Gemini现有模型规格高度吻合。爆料还提到,后台存在编号从00到09,一共10个专属训练槽位,专门留给这套RSI体系。
事情发酵之后,lyra直接@谷歌AIStudio负责人,直言谷歌不该因为这次泄露,直接批量吊销内部API密钥。他称这批密钥来自谷歌内部员工,可以访问上千个模型检查点。谷歌当晚紧急收回相关密钥,之后就不再发声,官方至今没有确认,也没有否认截图的真伪。
当然,这张截图本身无法被独立验证。不少人提出疑问:有可能只是内部测试代号,也可能是爱好者制作的恶作剧。可它之所以能短时间传遍整个AI圈子,并不是单凭一张截图,而是刚好和谷歌最近一系列动作完美对上。
二、微厨房作战室:布林押上全部资源豪赌RSI
如果说截图是流言,那谷歌联合创始人谢尔盖・布林在山景城总部的布局,是实打实被媒体拍到的现实。BusinessInsider报道,布林如今的办公地点,不是高管办公室,而是大楼里一间改造后的微厨房。
这里被改造成战时指挥中心,U型桌子围坐着DeepMind负责人,谷歌CEO劈柴哥每周会多次过来开会。这间微厨房最大的作用,就是绕开公司层层官僚流程,集中资源攻坚RSI。
作为谷歌的奠基人,布林对Gemini当前的追赶进度并不满意。OpenAI、Anthropic持续发力,谷歌旗舰模型多次延期,核心人才接连出走。单纯依靠传统模式堆算力、人工调参,永远只能跟在对手身后追赶。布林的解决方案,就是把赌注押在递归自我改进上。
在他的设想里,Gemini不再是传统大模型项目,而是像初创公司一样快速试错。人类研究员慢慢打磨模型的旧路径太慢,他想要一套可以自动迭代的循环:模型自己评估缺陷,自动生成改进方案,训练更强的新版本,新版本继续循环优化。
三、藏在官方博客里的伏笔:三周更新一次的Flash模型
很多人忽略,早在这次截图风波之前,谷歌已经在公开文档里,写下了关于递归自我精炼的描述。9月2日发布Gemini3.8Flash和Cyber版本时,官方博客有一句话,当时很少有人读懂分量:模型的进展,由长时间运行的智能体循环加速,循环用来递归评估、精炼底层模型。
翻译成人话:谷歌已经在用AI智能体,自动评估、优化大模型本身。
这次发布本身就足够反常,六周之内连续推出3个Flash版本,3.7Flash上线才三周,3.8Flash就接踵而至。传统AI研发,一轮训练、评估、调优,最少要一个季度,需要大量研究员、标注人员手动测评。三周一次迭代,人力根本跟不上这样的节奏。
新版模型成绩同样亮眼,3.8Flash在推理基准拿到54.9%,专门做漏洞挖掘的Cyber版本,真实漏洞挖掘成功率突破70%。DeepMind研究员姚顺宇当时点评,这对于模型只是一小步,但对RSI来说是巨大飞跃。另一位研究递归改进的研究员判断,这正是RSI飞轮产生复利效应的特征。
大家之前只是把这句话当成宣传话术,直到RSI模型截图流出,所有人回头重读这段文字,才意识到谷歌早把线索放在公开文章里。爆料账号lyra也提到,想要看懂这次事件,重点不是截图,而是Flash系列越来越快的迭代节奏。
四、全行业集体踩刹车:RSI已经不是理论设想
就在谷歌RSI传闻发酵的同一时间,AnthropicCEODarioAmodei发布长文,抛出一个让行业震动的判断:递归自我改进已经在全行业发生,Anthropic内部同样出现这个趋势。
他的态度充满担忧,呼吁行业主动放慢前沿AI研发速度,提出三步走的安全方案,引入第三方常驻评估人员,给前沿模型设置安全检查站。有意思的是,OpenAI的奥特曼、马斯克迅速表态支持。过去互相激烈竞争的巨头,在这个节点达成共识,侧面印证RSI不再是纸上理论。
不止Anthropic,OpenAI在7月公开,GPT模型已经可以辅助完成小模型的后训练,帮研究员节省数周的实验时间。各家实验室都在尝试,让AI参与AI研发,从写论文、设计实验,到生成训练代码。
但这里要分清边界。现阶段大部分厂商的成果,属于AI辅助人类做研究,AI只是研究员的工具。而谷歌博客描述的递归精炼,以及网传RSI模型,目标是形成端到端闭环,AI自主完成评估、迭代。两者之间,隔着一条关键鸿沟。
五、下一个Flash版本,就是最好的验证标尺
现在所有人都在等待一个简单的验证节点:三周之后,Gemini3.9Flash会不会按时发布。
如果3.9Flash如期上线,继续保持稳定迭代,性能稳步提升,那博客里那句递归精炼就不再是文字修辞。Flash的发布时间表,会成为RSI飞轮运转的直观证据。
过去三年的AI竞赛,比拼的是谁的模型更强。如果RSI闭环真正落地,游戏规则会彻底改写。比拼的不再是单次模型跑分,而是迭代循环的运转速度。模型能力只是中间产物,循环每转动一圈,能力就自动刷新一次。
在这个新体系里,人类研究员的位置会持续后移。一开始AI帮人写代码跑实验,之后AI独立完成训练循环,人类只剩下最后审核确认的权限。Anthropic曾经提出,人类最后的优势是“研究品味”,也就是判断研究方向是否值得探索。谷歌正在测试的,就是这条人类防线还能维持多久。
我们依然不能断定那张API截图是真的,谷歌也没有官宣实现完整RSI。但毋庸置疑,AI自我迭代的时代已经拉开序幕。一旦谷歌这条路线跑通,意味着AI拥有了自主进化的能力,这也是为什么,一边有人疯狂冲刺RSI,另一边行业大佬呼吁踩下刹车。
这场AI竞赛的下半场,比拼的不再是单纯算力,而是谁能先掌握自我进化的飞轮,同时守住人类可控的安全底线。
热门跟贴