智猩猩AI整理

编辑:林夕

近日,智谱创始人、清华大学教授唐杰现身新加坡国立大学,围绕大模型能力演进、Agent与AGI展开分享。

打开网易新闻 查看精彩图片

这场分享中,唐杰回顾了大模型过去几年的发展,也讲到了GLM迈向AGI的下一步。

打开网易新闻 查看精彩图片

在唐杰看来,下一阶段AI的重点已经不只是把聊天做长,而是让模型进入更复杂的环境,通过强化学习、持续学习等方式继续提升能力。

唐杰首先提到了大模型能力中的一个重要现象——能力涌现。

早在2022年,Wei等人的研究就曾讨论过这一现象:随着模型规模不断扩大,一些此前并不明显的能力可能在跨过某个临界点后出现明显跃升。

打开网易新闻 查看精彩图片

算术、翻译、解谜等任务都曾表现出类似特征。

也就是说,模型能力并不会随着规模增长一点点往上走,有些能力可能要等模型跨过某个临界点后才会突然出现。

在唐杰的梳理中,2020年至2026年的大模型发展大致经历了五个阶段:Knowledge、Chat、Coding、LHT和AAS。

打开网易新闻 查看精彩图片

从这条路线来看,大模型Scaling正在从预训练阶段的数据和参数规模,逐步延伸到后训练、任务环境和智能体系统。

在这条路线中,Knowledge阶段主要依靠预训练Scaling,Chat和Reasoning更多依赖SFT与人类反馈。

到了Coding阶段,SWE-Bench等任务开始提供更加明确的奖励信号,RL成为新的Scaling手段。

再往后进入LHT,模型需要在更复杂、更长的环境中持续完成任务,Scaling的对象也从模型本身扩展到环境的复杂度、多样性和运行长度。

到了AAS,模型不仅要完成长程任务,还需要维护系统、处理持续出现的问题,并进一步尝试通过RSI改进自身的模型、工具和训练系统。

在演讲中,唐杰还展示了2020年至今大模型在不同Benchmark上的成绩变化。

按照他的判断,当模型在一个领域达到80%左右的准确率时,已经可以成为一个显著有效的工具;当准确率达到90%-95%时,这个领域可能已经发生很大变化,人类在相关工作中将越来越难离开模型。

在这样的背景下,继续提高传统Benchmark上的分数,已经不是唯一需要关注的事情。

唐杰还用“KFC”概括了当前大模型所处的状态。

打开网易新闻 查看精彩图片

其中,K代表Knowledge。他认为,目前模型的Knowledge能力已经非常强,甚至Coding也正在被快速攻克。

F则对应模型能力进一步进入实际攻防等场景。例如Anthropic的Mythos等系统,已经开始改变AI安全攻防的格局。

而C所代表的,则是模型进入日常工作和生活。随着模型能力不断提高,越来越多工作已经开始依赖AI。

那么,接下来还有哪些能力需要继续Scaling?

唐杰认为,目前至少还有两个明显的Gap:一个是RSI,即模型自我迭代的能力;另一个是机器人进入物理世界后的行动能力。

在此基础上,唐杰进一步给出了GLM下一阶段的三个Scaling方向。

第一是预训练Scaling,继续增加数据和模型规模,提高基础模型的智能上限。

第二是后训练Scaling,通过SFT、RLHF以及RLVR等方式,进一步提升推理和任务解决能力。唐杰也提到,GLM-5.3正在沿着这一方向继续推进。

第三是推理与智能体Scaling,通过更复杂的环境、更困难的长程任务,以及更大的思考和操作空间,继续扩大模型能力。

而这也对应着智谱近期正在推进的研究。

今年7月,唐杰参与的论文Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning发布,研究长程Agent任务中的强化学习训练。

打开网易新闻 查看精彩图片

论文提出SAO,用单次rollout替代传统GRPO的group-wise sampling,同时处理Agentic RL训练中的异步和稳定性问题,相关方法已经用于GLM-5.2的训练。

打开网易新闻 查看精彩图片

对于Agentic RL来说,训练过程本身也发生了变化:模型不再只是生成答案,而是需要不断与环境交互。

因此,环境本身开始成为模型能力提升的一部分。

这也对应了唐杰此次重点谈到的另一个关键词:记忆。

在Agent时代,单纯扩大Context Window并不等于真正拥有长期记忆。一个长期运行的Agent,需要能够保存过去的经验,并在面对新任务时主动调用这些信息。

因此,唐杰认为,记忆的重要性可能高于单纯扩大上下文。

智谱近期也在围绕大模型记忆机制展开研究,对KV Cache、RNN/SSM、Titans、TTT、Engram等不同记忆机制进行梳理。

打开网易新闻 查看精彩图片

而这也进一步指向了唐杰所说的下一阶段——实时学习、在线学习以及自我进化。

如果模型能够持续进入新的环境、完成任务、获得反馈并保存经验,再把这些经验用于下一次任务,就开始具备持续学习的能力。

这也对应了唐杰此次分享中对Agent的一个判断:Agent将成为AI workers。

打开网易新闻 查看精彩图片

在这样的路线里,Agent不仅可以帮助人类完成办公、编程等数字任务,也可能进一步进入科学研究。

当AI能够自主提出问题、设计实验、调用工具、分析结果,再根据结果调整下一步行动时,Agent就可能从“AI助手”进一步走向“AI科学工作者”。

机器人则可能成为另一个重要突破口。

如果说今天的大模型主要在数字世界中学习和工作,那么机器人提供的是一个更加复杂的物理环境。

感知现实世界、采取行动、获得反馈,再根据反馈调整下一步行为,本身就是一个持续学习的闭环。

因此,唐杰也将机器人视为未来可能出现类似“GPT-4时刻”的重要方向。

回头看GLM的发展,从Knowledge到Chat,再到Coding、LHT和AAS,Scaling的对象已经从数据和参数,逐渐扩展到训练信号、任务环境和智能体系统。

GLM通往AGI的下一程,也正在从把模型做大,走向让模型持续行动、持续学习,并最终具备自我改进的能力。

关注+星标,获取AI前沿进展与开源一线动态