随着大语言模型规模持续增长和长上下文、Agentic AI 等应用场景快速发展,传统集中式推理架构正面临 GPU 资源利用率、KV Cache 管理效率、跨节点数据传输以及服务弹性扩展等多方面挑战。面向这些问题,大模型推理系统正逐步从单体架构向分布式、异构化和解耦式架构演进。
近日,趋境科技技术专家、Mooncake 核心贡献者杨珂,趋境科技软件工程师 Christian Angelo Velarde,与 Red Hat AI 资深机器学习工程师、llm-d 核心贡献者 Greg Pereira 受邀做客vLLM Office Hours全球直播间,共同带来Mooncake + vLLM/llm-d Deep Dive专题技术分享。
本次活动聚焦大语言模型推理基础设施的最新发展趋势,围绕 Mooncake、vLLM 与 llm-d 在大规模 AI Serving 场景中的协同与集成实践展开,并与全球开源社区开发者及 AI 基础设施专家共同探讨下一代 LLM 推理系统的架构演进方向。
活动开场环节,Red Hat AI 资深首席工程师、vLLM 核心维护者 Michael Goin 与 Red Hat AI 技术市场高级经理 Saša Zelenović 介绍了 vLLM 社区近期的发展动态与生态进展。
作为当前具有广泛影响力的大语言模型推理开源项目之一,vLLM 致力于提供高吞吐、内存高效的 LLM 推理能力,并持续拓展模型支持、硬件适配、推理优化工具及开发者生态。
Michael Goin 重点介绍了 vLLM 最新版本的多项进展,包括对 Kimi K3、Inkling Small、MiniMax H3 等新模型的支持,以及 Attention/FFN 优化、KV Cache 管理增强、硬件支持扩展等能力。vLLM v0.26 版本共包含来自 212 位贡献者的 411 项提交,持续汇聚全球开源社区力量,推动高性能推理技术不断演进。
杨珂在分享中梳理了 Mooncake 的设计理念与核心架构。他指出,随着 LLM 服务规模的增长,推理系统正加速从传统单体结构向分布式演进。
在这一过程中,计算节点之间的数据传输效率、KV Cache 的跨节点管理与复用,以及系统整体的资源弹性,正在成为决定推理效率的关键因素。
面向这一趋势,Mooncake 通过高性能通信、分布式存储为分布式推理提供高效的数据传输与 KV Cache 共享,并面向大规模专家并行场景提供高性能、高可靠的通信与弹性扩展能力。通过将通信、存储与缓存管理进一步解耦,Mooncake 为大规模分布式推理系统提供更加灵活、高效且可扩展的基础设施支撑。
在实际应用中,Mooncake 已在工业级 LLM 服务场景中得到验证,并支撑大规模生产环境运行。分享中介绍,Mooncake 作为 Kimi 背后的推理基础设施之一,目前已支持超过 80% 的 Kimi 流量,并通过持续优化推理架构提升系统整体吞吐能力。在趋境科技的生产环境中,Mooncake 为旗舰级万亿参数开放权重模型提供底层基础设施支撑,日均处理 Token 数超过 1 万亿,展现了其在超大规模模型推理场景下的性能、稳定性与可扩展性。
在专题分享环节,杨珂和 Christian Angelo Velarde 共同介绍了 Mooncake 与 vLLM/llm-d 社区的长期协作,以及围绕大规模 LLM Serving 场景开展的一系列深度集成实践。自 2024 年 12 月起,Mooncake 开始与 vLLM 生态展开合作,并持续面向 vLLM 和 llm-d 社区的大规模解耦式推理场景提供底层基础设施支持。
目前,Mooncake 已与 vLLM/llm-d 在多个关键场景形成深度集成:
- 在 Prefill-Decode 解耦推理场景中,Mooncake 提供高性能 KV Cache 跨节点传输能力,使 Prefill 与 Decode 阶段能够独立部署与扩展;
- 在分布式 KV Cache 场景中,Mooncake Store 支持跨实例缓存共享与复用,提升 KV Cache 的整体利用效率;
- 在多模态推理场景中,Mooncake 可作为 vLLM-Omni 不同推理阶段之间的数据传输层,为复杂数据流转提供高性能通信支持;
- 在投机推理训练场景中,Mooncake 通过 RDMA 在 vLLM 节点与 Speculators 之间高效传输 hidden state,为在线训练及推理协同流程提供底层通信能力。
上述集成已在大规模集群环境中完成性能验证,为 Mooncake 在生产级分布式推理场景中的应用奠定了基础。
围绕 Mooncake 与 vLLM 的具体集成,Christian 进一步介绍了基于 vLLM KVConnector 接口实现的两类核心能力。首先,MooncakeConnector 基于 Mooncake Transfer Engine,为分布式集群节点之间提供高效的数据传输能力。借助 GPUDirect RDMA 等技术,数据可在 GPU 与远端节点之间直接传输,减少不必要的中间数据拷贝;同时,Mooncake 还能够充分利用单机多网卡资源,进一步提升跨节点通信带宽与整体传输效率。
其次,MooncakeStoreConnector 构建了可跨实例共享的 KV Cache 池。系统可通过 Mooncake Transfer Engine 将 KV Cache Offload 至 CPU 内存或磁盘,从而突破单卡 HBM 容量限制,扩展可用缓存空间;结合基于哈希的去重与前缀缓存机制,不同 vLLM 实例还能够共享并复用已经缓存的 KV Block,在减少重复计算的同时提升缓存命中率和整体资源利用效率,并支持从单机到多机的灵活部署。
在底层实现上,Christian 还介绍了 Mooncake 在 vLLM 中的数据路径设计,包括 GPU HBM 与分布式 DRAM/SSD 存储之间的数据流转、基于 RDMA 的零拷贝传输,以及异步 I/O 优化机制。通过对数据传输路径和存储层级的协同优化,Mooncake 能够减少 KV Cache 在不同节点和存储介质之间的不必要拷贝,同时降低重复 Prefill 计算带来的额外开销,进一步提升跨实例 KV Cache 的共享与复用效率,为长上下文和大规模分布式推理场景提供更加高效的 Serving 能力。
随后,Greg Pereira 介绍了 llm-d 项目及其在大规模 LLM 推理服务中的应用。作为 Kubernetes 原生的分布式 LLM 推理框架,llm-d 通过模块化架构,将智能路由、KV Cache 管理、Prefill-Decode 解耦等能力整合到生产级推理体系中,为企业提供更加灵活、可扩展的大模型服务部署方式。
在与 Mooncake 的协同中,llm-d 可通过智能 Router 根据请求特征进行调度,并结合 Mooncake Transfer Engine 实现跨节点 KV Cache 的高效传输,使 Prefill 与 Decode 阶段能够分别部署、独立调度并进行针对性优化。通过将上层调度能力与底层高性能数据传输能力结合,该架构能够进一步提升 GPU 资源利用率和系统弹性,同时更好地满足复杂 Agent 工作负载对于长上下文缓存复用、跨节点数据传输和低延迟响应的需求。
通过 Mooncake、vLLM 与 llm-d 的持续协同,三者正在从推理引擎、数据传输、缓存管理到集群调度等不同层面形成更加完整的技术协作体系,共同探索下一代大模型推理基础设施的演进路径,为长上下文、Agentic AI 等复杂应用场景提供更加高效、弹性且可扩展的 Serving 能力。
此次参与 vLLM Office Hours 全球直播,是趋境科技持续参与全球 AI 基础设施开源生态建设的又一次实践。
作为 Mooncake 开源项目背后的重要推动力量,趋境科技长期聚焦大模型推理优化和下一代智能计算基础设施,并积极参与全球开源社区技术协作。通过与 vLLM、llm-d 等社区开发者和行业专家深入交流,趋境科技也进一步展示了 Mooncake 在高性能通信、分布式 KV Cache 以及解耦式推理基础设施等方向的技术探索与实践成果。
未来,趋境科技将继续积极参与全球开源社区建设,深化与产业及开源生态伙伴的技术协作,持续推动高性能、低成本、可扩展的大模型 Serving 技术发展,为企业级 AI 应用规模化落地提供更加高效、开放的基础设施支持。
热门跟贴