9月10日下午4点半左右,外滩大会入口不远的广场突然围满了一圈又一圈的人。
事情是这样的。中国工程院院士、阿里云创始人、之江实验室主任王坚上午「错过」了原定的主论坛分享,到了下午,他干脆把演讲搬到了户外。没有封闭会场,也没有什么仪式,观众就站在四周,越聚越多,后排的人甚至只能隔着人群听声音。
某种程度上,这反而是当天外滩大会最现场的一场分享。
还有一个很小、也很刻意的细节,王坚的PPT上写的是「年青人」,而不是更常见的「年轻人」。
这个用词当然不只是文字游戏。王坚这次分享的一个看法就是,AI时代需要更多「年青」的人——愿意相信不完美的新东西,愿意思考人类未来多过自己,愿意做一些暂时还没有答案的事情。
这恰好也对应了这届外滩大会给我的感受。
展馆里,AI已经很少只停留在模型参数和能力演示里。阿福开始帮普通人管理健康,阿宝开始替用户订票、点餐、打车、支付,越来越多AI Agent被塞进手机、眼镜、汽车和各种生活服务中。很多过去看起来离普通人很远的能力,正在被重新包装成一个个具体功能,直接进入日常生活。
而在论坛上也能看到,今天的大模型确实已经足够强,擅长学习已有知识、解决可验证的问题,在数学和编程中表现出惊人的进步,可一旦走向更开放的现实世界和科学发现,验证、反馈和自我修正依然是绕不过去的难题。
一边是AI加速进入普通人的生活,一边是技术先锋还在继续探索AI的下一步还能走多远。这两件事,也是我在今年外滩大会现场最关注的。
智能体,先让普通人用起来
过去一年关于Agent的讨论,很容易让人产生一种错觉:这是属于程序员、创业者、办公室白领的技术。
Coding Agent最早跑出来,随后是研究、办公、企业流程自动化。从Manus、Claude Code,到各家不断加码的Agent平台,行业最先证明了一件事——大模型已经能够从「回答问题」继续往前一步,自己拆解任务、调用工具,并尝试把事情做完。
更多的普通人呢?在今年外滩大会的展馆里,我看到了更多。
不仅在于我亲眼看到95后村官带着村里老人,集体来逛外滩大会,也在于从阿福到阿宝,很明显都在更多考虑聊天式AI、智能体AI对于「普通人」的用处。
图片来源:雷科技
「普通人」是所有希望保持健康、需要看病的人。
在未来健康中心展区,阿福出现在各种日常的场景。吃饭之前拍张照片,它可以结合体重、运动和健康数据给建议。体检报告看不懂,可以直接交给它解释。不管是未来医院,还是未来乡村诊所,问诊内容又可以被自动整理成病历,甚至帮助基层医生补充信息、判断是否需要进一步转诊。
图片来源:雷科技
用户开始不需要关心背后到底用了什么模型、调用了多少工具,甚至不需要理解所谓Agent到底是什么。拍照、说话、上传报告,然后拿到一个具体结果就够了。
这也是「阿福」以及这类产品最值得肯定的地方,即把过去需要一定专业知识才能理解、甚至需要找到专业人士才能获得的服务,变成所有人手边「唾手可得」的服务。
「普通人」也是所有关心柴米油盐酱醋茶的人。
点餐、打车、缴停车费、订票、找服务,本来分散在不同App、不同页面、不同流程里的功能和操作,都可以用一句话让「阿宝」去做。
不说不知道,一看确实「吓」一跳。坦白讲,我甚至今天才意识到,从OPPO小布到华为小艺,再到荣耀YOYO、小米超级小爱和vivo蓝心小V,国产手机五大厂商都已经接入了「阿宝」,让用户一句话就能借助「阿宝」实现各种生活服务。
图片来源:雷科技
不得不佩服支付宝,或者蚂蚁集团做智能体生态的决心和能力。
现场还有一个叫「咖啡闹钟」的演示。用户只需要设定一个需求,比如每天上午固定时间买一杯咖啡,后续任务可以由智能体持续执行。你不需要每天重新打开外卖App、搜索店铺、挑选商品、确认地址,再走一遍支付流程。
对普通用户来说,AI的价值,可能体现在这些琐碎的事情上。过去十多年,移动互联网不断把服务装进App,但现在Agent想做的,是把这些App里的步骤藏起来。
手机厂商希望系统级Agent理解长期记忆和实时上下文,再去调用不同服务。汽车里,智能体开始尝试直接处理停车缴费、寻找加油站甚至购买服务,AI眼镜也都在接入支付和生活服务能力。它们背后的逻辑其实都一样:
用户给出意图,Agent负责实现。
刘作虎在当天上午的圆桌上也把这件事说得很直白。过去手机更多承担连接人与App的角色,Agent时代,手机要进一步理解人的意图,并把意图直接推到结果。
图片来源:雷科技
所以今年外滩大会另一个比较明显的变化,就是大家开始关注这那些看起来不够「性感」的基础设施。在大会期间,还正式启动了两项由中国网络空间安全协会提出,蚂蚁集团联合研究院所、运营商、互联网厂商等单位共同参与编辑的团体标准——《智能体身份鉴定与授权技术框架》《智能体运行时安全技术要求》。
安全可信是底线,也是Agent走进普通人日常的关键前提。
另外值得注意的,还有支付宝在9月10日宣布设立的「智能体涌现奖」,每年投入1000万元,希望通过用户「许愿」和开发者响应,让更多智能体围绕真实需求被开发出来。
背后是一个很现实的产业难题。蚂蚁集团CEO韩歆毅也承认,「智能体经济」今年真正落地的速度,比去年行业预想得更慢。用户觉得可以用的Agent还不够多,商家看到用户规模有限,也缺少动力投入开发,供给和需求相互等待。
所以「许愿墙」和「涌现奖」,就是想先让这个飞轮转起来。让用户先说自己到底想让Agent做什么,再想办法让开发者和商家把服务补上。
AI已经足够聪明以后,也是时候让更多普通人真正用上它。
大模型,什么时候才能走出「已知」?
AI距离自主发现新科学、扩展人类知识边界,还有多远?外滩大会主论坛上,普林斯顿大学人工智能创新中心主任王梦迪问了一个重要的问题。
事实上,今天的大模型在很多情况下依然表现出明显的「Mode Seeking」(寻找众数)倾向,也就是更容易学习概率最高、最常见的部分,对长尾知识存在低估甚至忽略。
她和普林斯顿社会学教授谢宇做过一个很有意思的实验,让ChatGPT、Claude模拟1930年出生的英国人的一生。结果模型给出的人生往往更加「标准」,比如结婚年龄大量集中在24岁左右,而真实社会数据要分散、长尾得多。
图片来源:外滩大会
通俗地讲,大模型就是倾向「中不溜」的输出。
问题也在这里。大模型今天可以知道很多,甚至在各种测试里显得「无所不知」,但知道人类已有的知识,和创造此前没有的知识,仍然隔着很远。而在编程和数学之外,大模型也没有发现新的科学。
至少在物理、化学、生物这些尤其依赖实验的基础科学里,王梦迪认为,真正的新发现往往发生在「长尾」,甚至要走出现有概率分布,到训练数据里从未存在过的地方找一颗新的「星星」。
所以编程和数学为什么是「例外」?
众所周知,Agent最早引爆的就是Coding编码领域,而数学领域也在最近半年被大模型「攻破堡垒」,OpenAI最新的Agent甚至解决了一个数学界的「千禧难题」。可以说,模型已经能够长时间推理、反复尝试,甚至在部分任务里表现出越来越明显的自我修正能力。
一个关键原因是「验证器」。代码写完了,可以编译,可以跑Unit Test。数学证明则可以借助Lean等形式化系统验证。答案到底对不对,机器很快就能得到一个清晰反馈。有了这个反馈,强化学习就能真正形成闭环:
尝试、验证、修改,再尝试。
「当我有一个明确的验证器的时候,大模型就可以左右互搏。」王梦迪在现场说。源码资本投资合伙人、美国国家工程院外籍院士张宏江也指出,预训练更像给模型装进一个庞大的知识库,强化学习则进一步赋予了模型「学习怎么学习」的能力:
奖励函数给出方向,模型不断寻找工具、尝试路径,再通过验证改善自己。
图片来源:雷科技
张宏江甚至还谈到了最近半年火热的「递归式自我改进」,即AI参与提出新的训练和改进方法,再经过筛选、算力验证、重新训练,进入下一轮循环。
无独有偶,在一场分论坛上,生数科技再次展示了从L1「生成世界」、L2「交互世界」、L3「行动世界」,到L4「自主世界智能体」、L5「世界组织者」的迭代路线图,并且当场首发了瞄准L4阶段的Motus 2。
图片来源:雷科技
其中一个升级核心就是「闭环自进化」。按照生数的描述,Motus 2会比较不同候选动作,把评估结果继续用于策略更新,让同一个模型同时承担策略、模拟器和评估器的角色。简单讲,就是让模型在「行动—观察结果—评估—调整」的循环里,逐渐把事情做得更稳。
所以重点是什么?是AI的能力提升,越来越依赖「反馈」,但现实世界偏偏缺少这种廉价、快速、可靠的反馈。
科学实验不像代码,可以点一下运行马上知道哪里报错。一次新材料实验可能要几个月,仪器、环境、人的操作都会引入不确定性,很多实验甚至很难稳定复现。没有可靠的验证环境,模型再会提出想法,也很难知道自己的想法究竟对不对。
所以王梦迪最后谈到的重点,已经从「造一个更聪明的模型」走向了怎么改造实验本身。
她的团队正在把量子材料实验做成自动化闭环。从提出假设、设计参数,到实验操作、质量控制和显微观察,再把结果反馈回来。过去需要博士生几个月完成的实验流程,被进一步封装成API。
她们还在开发LabOS,希望把模型、科研人员、智能眼镜、机器人和实验设备连接到同一套系统里,让物理世界里的实验也变得可记录、可追溯、可验证。
图片来源:雷科技
过去几年,Scaling Law让行业习惯了继续堆数据、算力和参数。但如果AI真的要从学习人类已有知识,继续走向发现新的知识,光靠「知道更多」已经越来越难解释下一步该怎么走。
AI研究者才刚刚在编程、数学领域给出了一个答案,接下来还需要继续探索。
王坚在分享中还提到,这个世界从来没有向贝多芬提出过「我需要一首《第五交响曲》」,直到贝多芬把它写出来,人们才知道,生活里原来可以有这样一首曲子。
外滩大会上,阿福、阿宝让人看到AI原来还能这样进入日常生活,研究者也在继续探索大模型继续进化的方法。而新的用法和新的答案,都要先有人把它做出来,我们才知道AI还能走到哪里。
9月4日-8日,世界最大家电与消费电子展IFA2026在柏林盛大召开。
作为全球AI集体点赞的“IFA报道最强新媒体”,雷科技今年派出了史上规格最高、规模最大的探展团飞赴柏林,采取“2+N”(双主播+多名现场编辑+多名后台编辑)的模式,对IFA2026进行现场、立体、一手报道,共输出84条原创内容,在雷科技300万微信粉丝矩阵、千万级新媒体矩阵传播,全网阅读量/播放量预估超千万。我们对IFA 2026的报道再次得到了ChatGPT的AI认证“全网最强”。
IFA展已结束,雷科技IFA报道团5+人奔赴柏林展开现场报道,现已凯旋。欢迎在雷科技全平台获取相关内容。
期待27年1月CES,我们拉斯维加斯再见。
热门跟贴