Shubham Saboo 展示了一种面向智能体框架的新技术,名字叫「推测式程序化工具调用」。它的核心做法是,让大语言模型在流式输出 token 的过程中,一边生成部分代码,一边推测性地把工具调用排队。
工具调用变成 Future 对象
这些排队的工具调用会作为 Future 对象存在。代码生成一完成,它们就立即执行。这样一来,智能体不用等整段输出结束后再逐个发起调用,执行节奏被明显提前。
从架构上看,这项技术把「生成」和「调用」从串行变成了并行。LLM 不再先输出完整代码、再开始调用工具,而是在输出过程中就把后续动作准备好。附带视频演示了整个过程。
延迟是主要优化目标
推文把降低智能体框架的延迟作为直接收益。工具调用等待时间越短,智能体响应越快。对于需要多轮工具协作的任务,这种排队机制可以减少空闲等待。
该内容来自 Shubham Saboo 的推文,归类于人工智能领域,阅读时长约 1 分钟,原文为英文。
热门跟贴