Meta AI 放出一篇关于研究智能体的论文,讨论的核心问题很具体:当智能体要跑长周期研究任务时,它该怎么决定下一步去查什么。
这件事难就难在,选择下一步调查方向这类决策,在长长的执行轨迹里出现得很少,而且它的效果往往要过好几步才显现出来。决策稀疏、反馈延迟,学习起来自然吃力。
打开网易新闻 查看精彩图片
把智能体拆成两半
MIRA 的做法是把智能体一分为二。外层是一个元推理器,它读取一份持续更新的研究记录,然后写出一张"工作单",规定下一次调查要做什么。执行层则是一个全新的执行器,负责把每一张工作单落地完成。
这样一来,决策只发生在工作单的边界上。作者就在这些边界点上训练一个评论家,用来预测剩余回报;再训练一个单一的演员-评论家模型(MIRA-AC),让它既能评估阶段性进展,又能挑出下一次该调查什么。
不训练也能提升
论文里提到一个值得注意的结果:即便不做任何训练,这种拆分结构本身就已经改善了定理证明和开放式架构研究的表现。
而在用模型自身的代理信号进行训练之后,MIRA-AC 在四个自动研究环境里的金牌得分全部获得提升。
论文地址为 arxiv.org/abs/2610.02525,另有一个与论文对话的入口 academy.dair.ai/papers/learnin…。这条内容在社交平台上获得了 1,372 次浏览。
热门跟贴