当不少大模型公司还在比拼谁能读完更长的文档时,智谱创始人唐杰却给出了一个不同的答案:下一程的关键,不是把对话拉得更长,而是把智能的天花板一层层往上推。
近日,清华大学教授、智谱创始人唐杰在新加坡国立大学发表演讲,系统分享了GLM系列模型通往通用人工智能的路线图。
在他描绘的蓝图里,终点是一个能够递归自我改进的自治智能体系统,也就是让AI参与打造下一代AI。
这份路线图既是一家中国大模型公司的技术宣言,也折射出全球AI竞赛正在发生的方向转变。
一、能力是跳出来的,不是爬上去的
唐杰整套路线的理论根基,来自2022年谷歌等机构研究人员提出的大模型涌现能力研究。
这项研究发现,在算术、翻译、解谜等任务上,模型能力并不是随参数和数据量平滑提升的。规模达到某个临界点后,能力会突然出现跳跃。
这就像烧水,温度从90度升到99度,水看起来没什么变化,一过100度便开始沸腾。
在唐杰看来,这意味着单纯堆参数、堆文本长度,未必能带来智能的质变。真正关键的,是找到触发更高阶能力涌现的条件。
值得一提的是,涌现现象本身在学界仍有争论。美国斯坦福大学的研究人员曾在2023年神经信息处理系统大会上发表论文指出,部分所谓的突变,可能与评价指标的设计方式有关。
不过,无论涌现的本质如何,能力提升并非线性这一判断,已成为不少大模型团队制定路线的重要参考。
二、五级台阶通往自我进化
唐杰把GLM从2020年到2026年的发展划分为五个阶段。
第一阶段是知识,通过海量文本预训练打下基座,让模型学习世界知识。第二阶段是对话,借助监督微调和思维链,让模型学会与人交流、分步推理。
第三阶段是代码,用强化学习让模型在编程任务中锻炼逻辑、规划和纠错能力。
之所以选中代码,是因为程序能不能运行、结果对不对,都可以由机器自动判定,天然适合作为训练场。
第四阶段是长程任务。模型不再只做一问一答,而是要在扩大的执行环境中跨越多个步骤、长时间完成复杂工作。
第五阶段是自治智能体系统,并叠加递归自我改进能力,让AI参与下一代模型的评估、数据生成和训练优化。
贯穿其中的,是一条训练方式的升级链:从人类反馈强化学习,走向可验证奖励,再走向智能体强化学习。
人类反馈依赖大量人工打分,成本高、噪声大。可验证奖励则适用于数学、代码这类能自动判断对错的任务,模型可以自己试错、自己拿到反馈。
智能体强化学习更进一步,把模型放进真实的工具环境,让它像员工一样持续执行任务,在交互中学会规划、试错和回溯。这正是智谱当前主攻的方向。
三、四个判断与一个难题
演讲中,唐杰抛出了几个颇具锋芒的判断。
第一,基座模型只是入口而非终点,行业需要寻找超越o1式推理模型的新范式。
第二,智能体的本质是数字员工,而不是聊天助手。它可以承担科研实验和复杂工程,机器人领域也可能迎来类似GPT-4那样的爆发时刻。
第三,记忆比长上下文更重要。长上下文只是一个临时窗口,真正的高阶智能需要持久、可检索、可更新的记忆。
打个比方,长上下文像考试时允许带进考场的一大摞资料,而记忆则是学生自己长期积累、随时能调用的知识体系。
第四,离线训练、权重固定的模型存在天花板,只有实时在线学习、能够自我评估和迭代的系统,才可能逼近更高阶的智能。
这条路线与美国OpenAI形成了有意思的对照。后者先把推理能力做强,再向智能体拓展,而智谱选择让智能体、环境和可验证奖励并行推进。
据介绍,智谱已经做了初步的工程验证:由GLM驱动的基础设施智能体,帮助优化了国产十万卡集群的推理吞吐。
但唐杰也承认,完整的递归自我改进距离落地仍很遥远,目标设定和安全审核依然掌握在人类手中。
这种AI造AI的思路,与全球多家前沿实验室的长期设想不谋而合,但也正是安全研究者最为关注的领域之一。
这条路线最大的瓶颈,在于可验证的环境会越来越稀缺。数学和代码容易自动判分,但创意、审美和复杂的社会任务,很难给出标准答案。
当AI开始参与制造AI,如何确保它的进化方向始终可控,也将是整个行业必须直面的课题。
从读更多的书,到做更多的事,再到学会自我成长,这份路线图勾勒的不只是一家公司的野心,也是中国大模型在下半场竞赛中的一次方向选择。
热门跟贴