来自计算机科学与技术系的研究团队,联合NVIDIA和Flower Labs的 collaborators,提出了一种新的递归自我改进AI智能体方法。该方法让智能体通过反复测试和优化自身代码持续进步,同时避免频繁遇到的评估天花板。研究还提出了一种降低此类AI智能体开发所需计算资源成本的途径。 虽然智能体已经能够通过编辑自身代码、测试不同版本并保留更优改动来自我改进,但这一过程通常受限于固定的评估器、基准或测试套件。一旦智能体学会了固定信号所能区分的一切,改进就会减慢或停滞。 团队成员、机器学习系统实验室博士生Alex Iacob解释道:“自我改进的智能体只能达到与测试它的人一样好的水平。测试不仅衡量进步,还定义了进步,因此测试的有效性成为智能体无法超越的天花板。” 研究人员通过让智能体和评估器共同进化来解决这一问题。“我们不是让智能体在固定测试下改进,而是让评估与智能体一起进化,”Alex补充道,“随着智能体变得更好,评估也变得更难,标准持续上升。” Alex是研究团队刚上传至arXiv的预印本论文的第一作者。论文《The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators》分享了这项工作的技术细节,并展示了该框架在一系列任务中的显著成果。

打开网易新闻 查看精彩图片