阿里和字节跳动的最新研究揭示了一个关键变化:AI智能体(AI Agent)的服务方式,已经不能像处理普通大模型请求那样简单了。

这篇题为《From LLM Inference to Agentic Workloads: Characterization and Implications for Serving Systems》的论文指出,当前智能体应用的性能问题,大部分已经分散在工具调用、记忆管理、运行环境和模型本身等多个环节。瓶颈也不再固定于大模型推理,而是会随着请求和部署方式的变化,转移到嵌入向量(embeddings)、数据库、沙箱环境甚至网络传输上。

打开网易新闻 查看精彩图片

瓶颈转移:模型推理不再是唯一主角

为了验证这一判断,研究团队构建了名为AgentSysBench的基准测试平台,围绕10个真实的智能体应用场景展开测试。结果显示,模型推理往往不再是系统的主要瓶颈。这意味着,过去单纯追求“每秒处理多少token”的优化思路,已经不足以支撑智能体服务的性能需求。

论文给出的数据相当直观:采用任务感知的调度策略,延迟可降低29%至40%;通信感知的部署方式,最高能带来4.5倍的加速;状态卸载技术可将内存占用削减4.6倍;而缓存机制能消除35.2%的冗余搜索调用

从“token优化”到“全局调度”

这些数字背后是一个核心判断:智能体基础设施需要把模型、工具、内存和通信当作一个整体工作负载来统一调度,而不是各自为战。单纯优化大模型的推理速度,已经无法解决智能体服务中的大部分性能问题。

对于正在构建智能体应用或相关基础设施的团队来说,这篇论文提供了一个新的思考方向:当瓶颈不再单一,架构设计就需要从“模型中心”转向“系统全局”。谁能更高效地协调模型、工具、内存与通信资源,谁就更有可能在智能体应用的下一个阶段占据先机。