来源:蒙格斯智库

图源:pexels
打开网易新闻 查看精彩图片
图源:pexels

在二〇二五年七月上海举行的“世界人工智能大会”上,美国计算机科学家、图灵奖得主理查德•萨顿却出人意料地宣称:“人类数据时代已近结束,经验时代即将来临。”如何理解?

这句话是“强化学习之父”、图灵奖得主理查德·萨顿对AI发展范式切换的核心判断,本质是宣告大模型当前依赖“人类存量知识”的路线即将触顶,AI将转向“自主交互生成经验”的新路线。可以从三个层面理解:

打开网易新闻 查看精彩图片

什么是“人类数据时代”,为什么走到了尽头

我们当前所处的阶段,AI的核心训练原料是人类生成的存量数据:互联网文本、书籍、代码、人工标注内容,大模型的本质是把人类已经创造出来的知识、语言、逻辑“搬运”到参数里,再通过人类反馈微调对齐。

这个范式已经触及两个硬边界:

  • 数据存量见顶:高质量的公开人类语料已经被主流大模型基本消耗完毕,新增数据的边际价值急剧下降,继续堆参数、堆数据的收益越来越低,也就是行业普遍观察到的“规模壁垒”;

  • 能力天花板明确:基于人类数据训练的AI,本质是“复刻人类已有认知”,它无法产生真正超出人类知识边界的新发现,也做不到像人一样在环境里持续学习、终身进化,训练完成后就是静态的。

萨顿的判断是:靠“吃人类存量知识”这条路,已经走到了末期。

打开网易新闻 查看精彩图片

“经验时代”的核心:AI自己生成数据,自己进化

萨顿所说的“经验”,不是人类的经验,而是AI智能体通过与环境主动交互,自己产生的第一手数据,包含三个核心信号:观察(看到什么)、行动(做了什么)、奖励(结果好坏),这正是强化学习的底层逻辑。

和人类数据时代的本质区别是:

  • 数据不再是有限的人类存量,而是AI在自我博弈、与现实/虚拟环境交互中无限生成的。AI越强,能探索的场景越多,生成的高质量经验数据就越多,不会枯竭;

  • 学习不再是“模仿人类答案”,而是“在试错中总结规律”,就像AlphaGo自我对弈走出人类从未想过的棋步、AlphaProof自己推导出新的数学定理,AI可以产生人类没有的新知识;

  • 智能不再是训练完成后就固定的静态模型,而是可以持续学习、终身进化的动态智能体。

这也是萨顿一贯“痛苦教训(Bitter Lesson)”观点的延续:AI领域最终胜出的方法,是依赖大规模学习、大规模算力的路线,而不是依赖人类手工注入知识、手工设计规则的路线。

打开网易新闻 查看精彩图片

现实定位:是长期趋势,不是即时替代

需要明确的是,这不是说大模型立刻就会被淘汰,而是AI的核心增长动力正在切换:

  • 当前行业已经在往这个方向走:AI智能体、世界模型、强化学习对齐、合成数据,本质都是在摆脱对纯人类文本数据的依赖;

  • 但真正的“经验时代”还在早期,通用智能体的持续学习、现实世界交互的安全性、经验数据的质量控制,都还没有完全解决。

萨顿的判断更像是一个路线宣言:下一个阶段的AI,比拼的不再是谁能拿到更多人类语料,而是谁能让AI在真实环境里更高效地自主探索、自主学习。

特别声明:以上内容仅代表作者本人的观点或立场,不代表新浪财经头条的观点或立场。如因作品内容、版权或其他问题需要与新浪财经头条联系的,请于上述内容发布后的30天内进行。