智猩猩AI整理

论文作者投稿

打开网易新闻 查看精彩图片

当研究者面对一个真实的科研问题时,想找的往往不是“与某个关键词相关”的论文,而是同时满足多个条件、能够形成完整证据链的一组工作。这时,难点不只是“如何匹配论文”,更是“下一步应该去哪里找”。

针对这一问题,中国科学技术大学认知智能全国重点实验室团队开源PaperScout智能体,将学术检索建模为一个连续决策过程。

在 PaperScout 中,AI 不再机械执行固定的“先搜索、再扩展”流程,而是根据已经找到的论文,自主决定是发起新搜索,还是沿参考文献继续深挖。

为了训练这种多轮检索 Agent,研究团队进一步提出了面向完整交互序列的强化学习方法PSPO

实验表明,PaperScout 在召回率和相关性两个指标上,显著优于强大的工作流驱动方法以及强化学习基线,验证了 PSPO 策略的有效性。目前该成果已被EMNLP 2026收录。

打开网易新闻 查看精彩图片

  • 论文标题:

    PaperScout: An Autonomous Agent for Academic Paper Search with Process-Aware Sequence-Level Policy Optimization

01

复杂学术问题,不是

一次语义匹配

举一个例子:

寻找将强化学习用于蛋白质折叠、但不采用 Transformer 架构的研究。

这类问题同时包含主题、方法、应用场景和排除条件。单轮关键词检索或语义匹配,容易返回“主题相近,条件却不满足”的结果。研究者仍然需要反复改写查询、逐篇筛选,再沿参考文献继续追踪。

近年来,大语言模型开始参与查询改写、候选筛选和引用扩展,但不少系统仍然依赖预先写好的流程。流程变复杂了,真正决定“何时搜索、何时扩展、何时换方向”的,依然是人工规则。

打开网易新闻 查看精彩图片

图 1:学术检索从单轮语义匹配、固定工作流,走向能够自主观察和决策的 Agentic Search。

02

PaperScout:

自主决定“搜”还是“扩”

PaperScout 将论文检索建模为一个部分可观测马尔可夫决策过程(POMDP)。通俗地说,检索不再是一次性的“查询—返回”,而是一段不断观察、行动和更新的探索过程。

在每一轮中,PaperScout 都会维护一个动态“论文池”,记录候选论文的内容与元数据、它们与用户问题的相关程度,以及参考文献是否已经被探索。然后,Agent 根据当前论文池和历史记录,自主选择两类动作:

  • Search:生成新的检索式,寻找新的候选论文;

  • Expand:选择一篇已有论文,沿其参考文献继续探索。

新获得的论文经过相关性判断与去重后,会回到论文池中,成为下一轮决策的新证据。

关键在于,Search 和 Expand 不再以固定顺序出现。当某条引用链仍有价值时,PaperScout 可以继续深挖;当扩展结果趋于饱和时,它又能重新搜索,打开新的研究方向。

打开网易新闻 查看精彩图片

图 2:PaperScout 维护动态论文池,并根据当前观察自主调用 Search 或 Expand。

03

PSPO:让优化粒度对齐

Agent 的真实动作

让 Agent 学会自主决策,关键难题是如何稳定地训练它。

在多轮论文检索中,环境通常在一次完整回复和工具调用之后,才能判断这一轮是否找到了新的相关论文。但经典 PPO 主要在 token 层面优化,需要把一个交互级反馈分摊给回复中的大量 token。

这会产生一种“粒度错位”:Agent 的真实动作是一整轮搜索或扩展决策,优化算法处理的却是组成这次决策的单个 token。本应评价“这一步找到了多少有价值论文”的反馈,因此容易被稀释。

为此,研究团队提出Proximal Sequence Policy Optimization(PSPO):将每轮生成的完整回复视为一个原子动作,在交互序列层面估计优势并更新策略;同时保留逐轮过程奖励,让模型知道“究竟是哪一步带来了新论文”。

打开网易新闻 查看精彩图片

图 3:PPO 在 token 粒度处理交互反馈;PSPO 将一次完整响应视为原子动作,进行序列级优势估计与重要性采样。

PaperScout 的单步奖励同时考虑两件事:奖励新获得的高相关论文,惩罚重复查询或重复扩展。因此,Agent 学到的不只是“最后找到了多少”,还包括“每一步是否有效”。

04

实验:4B 模型也能学会

高效多轮检索

研究团队在两个学术检索基准上进行了评估:包含真实专家查询的RealScholarQuery,以及由顶会论文构造的AutoScholarQuery

PaperScout 使用 Qwen3-4B-Instruct-2507 作为骨干模型,并与 Google Search、Google Scholar、PaSa、SPAR 以及未经过强化学习训练的不同规模模型进行比较。

RealScholarQuery上,PaperScout 的 Recall 达到0.574,高于最佳对比系统的 0.541;F1 达到0.441,相比最佳基线的 0.417 相对提升5.8%;LLM 相关性评分为2.576,Recall@all 为0.691

AutoScholarQuery上,PaperScout 取得0.459 Recall0.134 F12.467 LLM 相关性评分0.811 Recall@all

更值得关注的是,在相同工具调用次数下,PaperScout 通常能获得更高的召回率。经过 PSPO 训练的 4B 模型,在较宽的工具调用区间内可以匹配甚至超过未经强化学习训练的 Qwen3-Max。这说明,对于多轮学术检索,学会更有效地使用工具,可以弥补模型规模的差距。

打开网易新闻 查看精彩图片

图 4:在 RealScholarQuery(上)和 AutoScholarQuery(下)上,PaperScout 在相同工具调用次数下取得更高召回率。

PSPO 与其他优化方法的直接对比也支持了这一结论。在 RealScholarQuery 上,PSPO 的 Recall 为0.574,高于 GSPO 的 0.557 和 PPO 的 0.537。

05

它是如何搜索的?

论文展示了一个与 CLIP、ViLD 和 RegionCLIP 相关的复杂检索案例。

面对初始问题,PaperScout 首先将需求拆解为多个语义侧面,分别发起与 CLIP visual localization、ViLD model 和 RegionCLIP model 等相关的搜索,快速获得种子论文。

随后,它选择 RegionCLIP、ViLD、RegionBLIP 等高相关工作进行参考文献扩展,逐步深入区域级视觉语言学习方向。

打开网易新闻 查看精彩图片

当沿已有论文继续扩展的边际收益下降时,PaperScout 没有机械地重复 Expand,而是重新发起关于 fine-grained region understanding 的 Search,打开新的检索分支,再继续扩展 FILIP、BLIP-2 等相关工作。

打开网易新闻 查看精彩图片

图 5:PaperScout 根据已有上下文在 Search 与 Expand 之间动态切换,并在扩展收益下降后主动开辟新方向。

这个过程很像研究者真实的文献调研:先广泛寻找入口,再沿关键工作深挖;当局部线索趋于饱和后,主动换一组概念重新搜索。PaperScout 学到的,正是在“广度”和“深度”之间动态切换的能力。

06

不只是一个新的论文搜索器

PaperScout 展示了两个值得关注的方向。

第一,学术检索正在从“更好的语义匹配”走向“自主的信息探索”。系统不再只负责对已有候选进行排序,而是主动决定去哪里寻找信息、沿哪条线索继续追踪,以及何时改变方向。

第二,Agent 强化学习需要与真实交互粒度对齐。许多工具型 Agent 的动作,本质上都是一次完整响应触发的一组工具操作。PSPO 所关注的序列级优化和过程奖励,也为训练其他多轮、工具增强型 Agent 提供了新思路。

07

当前边界

论文同时指出,PaperScout 仍有进一步拓展的空间:当前评估主要集中在计算机科学领域;检索范围受公开搜索引擎和开放论文库限制;现有检索后端来源仍然有限;引用扩展主要沿论文参考文献向后追踪,尚未充分利用后续引用和更完整的引文图信号。

更广的学科覆盖、更多源的学术检索、更完整的引文图探索,以及面向真实科研任务的长期自主搜索,都是值得继续探索的方向。

08

相关基准:ScholarQuest

围绕自主学术论文搜索,研究团队还构建了大规模、分类体系引导的评测基准ScholarQuest,用于系统评估开放文献环境中的 Agentic Academic Paper Search。

ScholarQuest 基于 1,000 余个计算机科学主题,覆盖方法导向、设定锚定、比较型和范围约束型四类代表性研究意图,并提供可扩展的答案构建流程与共享检索后端ScholarBase,以支持可复现评测。

评测结果显示,Agentic 方法整体优于单次检索基线,但当前最佳 Agent 的 Recall@100 仅为0.314,Recall@All 为0.355,说明真实开放文献环境下的自主学术搜索仍有很大提升空间。

如果说 PaperScout 关注的是“如何训练一个更会搜索的 Agent”,那么 ScholarQuest 关注的则是“如何在更真实、更系统的环境中评测它”。二者分别从方法与评测两个方面,推进自主学术搜索 Agent 的研究。

09

总结

搜索论文,表面上是寻找文档;更深层次上,它是在一个不断扩展的知识网络中连续决策。

PaperScout 让 AI 从“执行检索流程”走向“自主规划检索过程”:它会观察已经获得的证据,判断下一步应该搜索还是扩展,也会在旧方向趋于饱和时主动寻找新入口。PSPO 则让这种多轮决策能够在更合适的粒度上得到训练。

目前,PaperScout 的论文、项目主页和代码,以及 ScholarQuest 基准论文均已公开。欢迎读者阅读论文、试用项目,并与研究团队交流复杂学术检索与工具增强 Agent 的更多可能。

关注+星标,获取AI前沿进展与开源一线动态