每个Agentic RAG教程的结尾都一样:选一个搜索API,接进你的LangGraph节点,上线。但到底该选哪个?各家文档都宣称自己准确、快速、AI原生,等你真正围绕它搭建完系统,才发现哪个在说谎。
与其读官网的营销文案,不如直接跑数据。我用了100条真实查询,分别通过Tavily、Exa和Brave Search执行,对比三家在Agentic RAG场景下的实际表现。
这100条查询不是合成的,全部来自我日常工作中实际遇到的四类场景:25条新鲜新闻查询(本周发布了什么)、25条长尾检索(Google埋掉的内容)、25条代码上下文搜索(跨网页搜索API名称)、25条命名实体查询(人物/产品/论文)。每个API收到完全相同的查询字符串、相同的10条结果上限、相同的下游合成步骤。唯一变量是搜索后端。
为什么选这三家,而不是其他十二家?
2026年的搜索API市场相当拥挤。Perplexity、You.com、Firecrawl、Linkup、Parallel、Serper、Kagi,加上五六个会议上常听说的垂直索引。我选Tavily、Exa和Brave,是因为它们恰好代表三种不同的“Agentic搜索”理念:
- Tavily:AI优先排序器。它的卖点是API已经知道你是Agent,结果自带摘要和评分标签,可以直接交给LLM。
- Exa:专有索引上的神经向量搜索。语义相似度在查询模糊时胜过关键词匹配。
- Brave Search:独立网页索引,返回普通SERP形态的结果。无第三方依赖,无重排层,就是纯粹的网页。
三种理念,三个API,一个Python测试框架。哪个理念在我的100条查询上胜出,就能说明哪个理念更适合你的场景。
测试框架,比你想的简单
整个基准测试框架不到200行代码。每个API封装成一个search(query: str) -> list[dict]函数,返回标题、URL、摘要、评分和延迟毫秒数,原始JSON记录到磁盘,然后top-10结果交给LLM合成器生成一段答案。评判标准是人工标注的:在跑任何API之前,我先写下每条查询的正确答案长什么样。
所有查询跑了两遍,在两个不同的早晨执行,以消除瞬时故障和索引新鲜度的影响。两次运行在每个指标上误差都在5%以内,下面数字是两次的平均值。
计分板:总成绩几乎持平
最令人意外的发现是:三家API的总分差距极小。在聚合层面,所有指标都咬得很紧。但拆开看四个查询类别,差异就非常明显了。
新鲜新闻查询:Tavily领先
在25条“本周发生了什么”的查询上,Tavily的答案质量明显更高。它的AI优先排序器在处理时效性内容时优势突出——结果摘要直接包含发布时间和关键实体,LLM合成时几乎不需要额外清洗。Brave紧随其后,Exa在新闻类查询上表现最弱,向量搜索对“刚发生的事”天然不敏感。
长尾检索:Exa反超
在Google埋掉的那些冷门内容上,Exa的神经向量搜索展现出真正的价值。当查询词模糊、关键词匹配失效时,语义相似度能挖出Tavily和Brave都找不到的页面。这一类别上Exa的答案准确率比第二名高出近15个百分点。
代码上下文搜索:Brave意外胜出
跨网页搜索API名称和代码片段,Brave的独立索引反而表现最好。原因可能是它的索引对技术内容覆盖更全,且SERP形态的结果保留了更多原始上下文。Tavily的摘要层在代码场景下反而丢失了关键细节,Exa的语义匹配在精确API名称上优势不大。
命名实体查询:三家打平
在人物、产品、论文的查询上,三家差距在统计噪声范围内。这类查询信息密度高,任何一家搜索引擎都能给出合格结果,API之间的差异被下游LLM合成器抹平了。
延迟对比:Brave最快,Exa最慢
平均延迟方面,Brave Search以明显优势领先,Tavily居中,Exa最慢——向量搜索的代价是额外的计算时间。如果你的Agent对延迟敏感,这个指标可能比答案质量更重要。
结论:没有全能冠军,只有场景匹配
跑完100条查询,我的结论是:选API不是选最好的,而是选最匹配你查询分布的。如果你的Agent主要处理新闻和时效内容,Tavily的AI优先排序值得多付的成本;如果你的查询偏长尾和模糊,Exa的向量搜索能挖出别人找不到的东西;如果你要的是纯粹、快速、无依赖的网页搜索,Brave是最稳的选择。
更重要的是,这个测试框架本身不到200行代码。与其读文档猜,不如花一个下午跑一遍自己的真实查询。数据不会说谎。
热门跟贴