前 Twitter CEO Parag Agrawal 现在做了一件新事。他在 20VC 访谈里用一句话介绍自己的公司 Parallel:为智能体建立类似搜索引擎的基础设施。他预计,智能体调用网络的频率会远高于人类。

这个预测还没被市场验证,但它抛出了一个很具体的工程问题:如果每个智能体都照搬人的搜索流程,检索、抓取和模型推理的总成本能不能扛住?

打开网易新闻 查看精彩图片

智能体搜索,和人搜的不是一回事

人往往输入简短关键词,翻看搜索结果,再自己打开网页。智能体可以把任务写成完整请求,却未必需要十条链接。它可能需要的是能直接送进模型的文本、附有来源的证据,或者供后续步骤使用的文件。

任务时限也分化得更厉害。语音助手背后有人在等,后台研究任务则可能愿意多等一会儿,换一个更完整的答案。Agrawal 说,Parallel 因此提供不同速度和深度的搜索模式,开发者可以按应用选择,也可以让系统知道结果将交给哪一种模型处理。

这里的取舍不是让搜索永远更快,而是协调搜索和模型各自花多少计算。检索系统先用便宜的筛选缩小网页范围,再对较小的一批候选投入更复杂的排序,最终只把最有用的信息交给模型。

如果后续模型价格昂贵,多做一点检索可能减少模型读无关文字的费用;如果模型更便宜,另一套信息压缩方式可能更划算。该比较的是整个任务的质量、等待时间和总成本,而不是单次搜索调用的标价。Agrawal 提到的计算成本优势属于 Parallel 自身估计,不能据此断言其他服务在所有任务上都会更贵。

内容被智能体读走,钱从哪来

搜索的另一半是内容从哪里来。靠广告支持的网站通常从人的访问中获得收入。智能体读取页面、提取内容后离开,可能不产生可见的广告回报。

Agrawal 提出为内容所有者建立类似智能体版 AdSense 的补偿方式,按信息给任务带来的贡献支付。他举了一个用于思考定价的例子:如果少了某份数据,智能体必须多花推理资源才能达到类似质量,这份数据就创造了可以衡量的价值。

这是他正在推进的商业方案。贡献如何测量、内容所有者如何议价、不同搜索服务如何共同遵守,访谈并没有给出现成答案。

这个问题尤其关系到独特数据。受访者用投资人结合商业数据库、个人笔记与公开信息的工作来说明:按人头售卖数据的模式,未必能直接覆盖代人工作的智能体。若内容提供者只能选择封锁,智能体可能失去关键材料;若使用方可以按贡献付费,双方才可能维持开放访问。

内容补偿与检索效率其实是一笔账的两面。前者决定好信息能否进入系统,后者决定系统能否以合理成本使用它。不能因为现有广告格式不适合智能体,就推断广告业务已经消失。

从反复查询,转向事件响应

Agrawal 还描述了一个从查询转向事件的入口。现在的后台智能体常按固定时间反复搜索,再比较有没有新结果。Parallel 的 Monitor API 尝试持续监测网页变化,先判断变化是否与用户关注的事件相关,必要时才调用更深入的分析。

访谈中的示例是跟踪新登记公司,等符合条件的信息出现再通知用户。这样能避免为了确认「还没有变化」而反复做完整推理。节省幅度依赖事件频率与任务设计,不能直接套用到所有监测工作。

这篇访谈适合用来重画智能体搜索的评估表。一次结果是否有用只是第一格,还要看不同任务的时延、搜索与模型合计的计算量、内容所有者是否愿意持续提供材料,以及持续运行时能否从轮询转成有意义的事件响应。

访谈者也谈到安全和社会信任,但与今天主题最直接相关的,是开放网络能否同时满足访问者与提供者的激励。这个判断还需要产品运行和商业合作继续验证。

长时程智能体,需要的是实验

一个游戏角色能记住刚才的对话、走到约定地点、拿起点心,这样的演示很容易让人相信它已经拥有稳定的社会行为。Erina Karati 在 AI Engineer 的分享把时间拉长:当一条消息经过几个人转述,又被后续事件打断,角色还能说清谁告诉了它什么、哪些只是猜测、应该怎样更新计划吗?

她曾参与 Supercell AI Innovation Lab 的 Project Paradox,这套框架把自主角色放进能与玩家及彼此互动的游戏村庄。村庄里的角色有各自的记忆空间,还会根据事件更新情绪、信任和对他人的看法。记忆被检索出来,影响下一次对话或行动;重要事件也会被优先保留。

这些设计让短期互动看起来连贯,却不能保证长期一致性。Karati 举出芒果促销传闻:消息在角色之间传播后,回答者可能只剩模糊印象,记不起来源;转述过程还可能把「听说有促销」变成「确定有促销」。另一个常见失败是记住事实却没有在安排动作时使用它。

她提出把改进智能体的工作转成自动化实验。先设计可控场景,例如一位角色得知面包店即将关门,观察消息怎样传给其他人;或让一个角色听到某人可能离村,看不确定性会不会逐步消失;再或者让计划中的路线被堵住,检查角色是否重新规划并通知同伴。

场景有起点、预期和可观察的过程,团队便能判断行为有没有真正改善,而不是凭一个剪辑后的片段作决定。

每次运行都会留下轨迹:角色看到了什么、与谁说话、写下什么记忆、取回什么材料、信任度怎样变化、最后做了什么。评测层可以读取完整轨迹与场景设定,对照角色的实际行动;角色本身仍只拥有局部视角。

这个区分很关键。如果测试时偷偷给角色一份共享的全知记忆,原本要测的信息传播能力就被跳过了。评估单位从一句回复变成整段运行,可让传闻失真和行动脱节这类问题显现出来。

评分也不能只剩一个模糊的「智能体质量」。信息传播得快,是一个维度;知道消息的人能否记住来源,是另一个;传闻是否保留不确定性、角色有没有误报、能否及时重新规划、私人信息是否被不当传播,都需要分别看。

只奖励传播,角色可能过度分享;只奖励记忆量,检索又会被噪声淹没。多维评分让团队看见一次优化在别处付出了什么代价。

打开网易新闻 查看精彩图片

Karati 建议冻结测试场景和评分方式,只让研究循环修改一小块策略,例如记忆写入格式、检索规则、沟通提示,或者触发重新规划的条件。若来源不断丢失,可以在记忆中保留讲述者;若传闻逐渐变成事实,可以记录信息是一手观察还是转述,以及确信程度。

改动后重跑相同场景,只有整体评分改善、护栏仍成立时才保留,否则回滚。她报告,芒果促销案例在较长循环之后出现了更合适的回答;她没有把这次改善宣称为系统的普遍提升。

游戏村庄只是便于观察的实验场。客服智能体要处理政策的新旧版本,个人助手要记住用户更改过的承诺,研究智能体要保留假设和引用来源,编程智能体要在变动的需求之间维持上下文。它们并非共享同一套现成场景,但都面临状态随时间改变的问题。

读者可以从这篇带走一套顺序:先描述具体失败,再设计可重复场景,记录足够完整的轨迹,用多维指标评估,最后只开放可回滚的有限改动。这样才能知道系统是在变好,还是只是换了一个更会表演的演示。

循环才是产品

实验发现智能体会犯错,下一步是让这种发现改变产品。Roland Gavrilescu 在 AI Engineer 演讲中提出,把工作、验证与反馈的持续循环视为智能体产品本身。他与联合创始人曾在 xAI 从事智能体基础设施工作,演讲谈的是他们正在探索的产品方法,而非一个已在所有行业验证的结果。

它与上一篇的共同点是重视完整运行;侧重点则从游戏角色行为,转向团队如何保存并迭代对「好工作」的判断。

他把执行任务的智能体视为内层循环。智能体调用工具、观察环境、提交结果,同时留下轨迹、文件和用户反馈。外层循环查看这些材料:反复出现的错误,可变成下一轮必须通过的评测;持续有效的做法,可写成可复用技能或提示词;用户的抱怨,可能要求修改工具、记忆或运行环境。这一步被他称作系统蒸馏。

关键并非让模型凭空自我改进,而是将一次工作的经验整理为下一次能检验的改变。

为承载这些改变,他提出可版本化的智能体 recipe。它不只是一组提示词,还可记录所用模型、运行框架、工具、评测、资源以及人的判断标准。版本历史使团队能追问:这项改动从哪种失败出发,为什么被接受,换了模型或供应商以后是否仍然成立?

他希望方案可由使用方掌握,避免产品经验只留在某家模型供应商或某次运行里。演讲介绍了早期 recipe 实现,但可移植程度与维护成本还需要在真实客户工作中检验。

招聘案例说明「人的判断」如何进入循环。假设一个人才搜寻智能体总是接触大型科技公司的员工,因为这些履历显眼;招聘方真正想找的,却是不易被常规名单发现的合适人选。团队先从执行轨迹里找出这个模式,再让评测判断候选人是否符合寻找隐藏人才的方向。

人需要校准评测:这个偏好是否真是招聘方的选择,评测是否把偏好表达准确。人不一定亲手写完每条测试,但不能把取舍完全交给自动生成的指标。

通过离线评测还不够。产品团队要继续看用户是否认可新结果,必要时用线上实验比较不同方案。如果设计者觉得候选人更有意思,实际招聘者却不满意,产品仍然没有改对。只有离线判断与真实使用形成一致反馈,改动才有理由晋升为下一版 recipe。

这个例子展示的是建议中的流程;演讲没有给出跨公司、跨岗位的受控数据,不能据此声称所有招聘任务都已受益。

最后,他提出衡量「每单位计算资源产生的有价值工作」。这句话包含两个不同问题:结果对客户是否有价值,完成同等价值需要花多少成本。一个演示可能很惊艳,却依赖过高的推理费用;另一个系统可能便宜,但结果不被用户信任。把质量、用户偏好和成本放在同一循环里,才更接近可持续产品的判断。

这里没有现成的通用公式,不同垂直领域得先定义自己的有效工作,再建立可靠评测。

将这篇与 Karati 的实验放在一起,能看见反馈循环的两个层次:前者研究长时程角色能否保留来源、处理不确定性;这篇研究团队能否把失败与用户偏好变成可追溯的产品版本。两者都需要知道自己测量的究竟是什么。

对于正在打造垂直智能体的团队,一个可操作的问题是:当用户说结果不好,你们能否从轨迹定位原因,提出有限改动,并在真实使用中证明新版本更受认可?

速览里的几个信号

Anthropic Research 刊登的客座文章记录了一次理论物理挑战:Claude Science 采用已有的 bootstrap 与 form-factor 方法,计算出 N=4 超杨-米尔斯理论的九圈振幅。物理学家 Lance Dixon 独立核验了结果。文章聚焦的是人工智能能否在较少外部科学指导下完成复杂计算,而非宣称找到新的物理定律。

任务难在要把多步符号推导、计算策略和最终结果持续保持一致。这里计算的是 N=4 的玩具模型;文中提到的暗物质猜想用的是 N=1 超对称,不能混为现实物理的新结论。作者强调,方法本身没有突破原有计算极限;另一研究团队也在相近时间取得相关结果。

Skydio 的技术分享展示一名操作员同时操作三架无人机。讲者把多机任务拆成若干需要协同的能力:视觉感知、目标跟踪、地图式世界模型、飞行决策,以及让人员能够介入的任务控制。

其中一个困难是遮挡。目标暂时离开摄像头视野,系统仍要利用已有状态推测位置,并在重新出现时恢复跟踪。飞行数据回流又让团队持续分析失败场景;边缘计算负责现场响应,云端能力提供更复杂的理解和协作。所谓自主,并不等于操作员从任务中完全消失。

Perplexity 将核心搜索服务中的 DynamoDB 替换为自己用 Rust 编写的分布式键值存储 CobbleDB。根据其工程数据,批量读取延迟约降至原来的五分之一,整体存储费用至少减少百分之二十。这是特定访问模式与负载下的工程收益,不是所有应用迁移数据库的通用预测。

搜索请求对读取延迟、吞吐和成本都敏感。托管数据库减少日常运维负担,却未必总能精准匹配规模化后的访问路径。Perplexity 的选择表明,当查询形态相对稳定、资源消耗已经足够大时,团队可以重新比较通用服务的便利与自建系统的长期维护成本。

这几条速览适合与智能体搜索的成本讨论对照:用户只看到一次回答,后台却有检索、存储、模型推理多笔费用。真正有参考价值的做法是先量出自己的瓶颈和负载,再决定是否值得承担专用基础设施的复杂度。