智能体怎样才算强?他给出了一个很务实的判断:不要只盯着榜单,也不要只把环境越做越大,而要到真实场景里验证效果。 他的研究方向是通用智能体训练,目前重点关注递归自我改进(RSI)——让 Agent 自己发现知识缺口,主动探索和学习,并在尽量少的人类监督下持续改进。 训练环境从哪儿来?用现成的、自己搭,还是让模型模拟一个世界?在他看来,这些路线最终都要回答同一个问题:模拟环境里练出来的 Agent,到了真实世界,能不能把外卖订成、把机票订好,真正帮到用户。 榜单高分不等于生产力。智能体够不够强,最终还是要归回到真实任务里,看它能不能切实帮人把日常琐事做好。
智能体怎样才算强?他给出了一个很务实的判断:不要只盯着榜单,也不要只把环境越做越大,而要到真实场景里验证效果。 他的研究方向是通用智能体训练,目前重点关注递归自我改进(RSI)——让 Agent 自己发现知识缺口,主动探索和学习,并在尽量少的人类监督下持续改进。 训练环境从哪儿来?用现成的、自己搭,还是让模型模拟一个世界?在他看来,这些路线最终都要回答同一个问题:模拟环境里练出来的 Agent,到了真实世界,能不能把外卖订成、把机票订好,真正帮到用户。 榜单高分不等于生产力。智能体够不够强,最终还是要归回到真实任务里,看它能不能切实帮人把日常琐事做好。
