livekit 团队 2026 年发布的 livekit/agents 是实时语音 AI Agent 框架的事实标准,GitHub 累计 5,000 加 stars,GitHub Trending 周榜常客。

打开网易新闻 查看精彩图片

项目定位

livekit/agents 不是 OpenAI Realtime API、Google Gemini Live、Anthropic Claude Voice 那种 LLM 厂商原生语音 API,而是独立的实时语音 AI Agent 框架。

核心能力

业务方可以接入任意 LLM(GPT-4o Realtime、Claude Voice、Gemini Live、Llama、DeepSeek),加上 STT(Whisper)、TTS(ElevenLabs、自家模型)、工具调用、多模态。

上手门槛

5 分钟搭一个生产级实时语音 AI 助手。

底层整合

跟 LiveKit 的 WebRTC 媒体服务器深度整合,业务方用 LiveKit Cloud 部署 WebRTC 全球低延迟(低于 200 毫秒)语音、视频通话,AI Agent 跑在后台,前端是 Web、iOS、Android 多端。

多 LLM 加 STT 加 TTS 自由组合

livekit/agents 的核心设计是多 LLM 加 STT 加 TTS 自由组合。业务方在 config 里定义 pipeline,STT 转语音为文本,LLM 推理生成回复,TTS 合成回复为音频。

支持的 STT

Whisper、Deepgram、AssemblyAI。

支持的 LLM

GPT-4o Realtime、Claude Voice、Gemini Live、Llama、DeepSeek。

支持的 TTS

ElevenLabs、Cartesia、自家模型、Edge TTS。

混搭案例

用 Whisper STT(便宜)加 Claude 3.5 LLM(精准)加 ElevenLabs TTS(自然),成本只有全用 OpenAI Realtime API 的 1/5。

流式 pipeline

STT 一边识别一边把增量文本喂给 LLM,LLM 流式输出 token 喂给 TTS,TTS 流式合成音频推给 WebRTC,整链路延迟低于 800 毫秒。

打断逻辑

用户说话打断 AI 回答,livekit/agents 自动停止当前 TTS 流,启动新 turn,这个是 OpenAI Realtime API 之前做不到的(2025-12 才补)。

WebRTC 全球低延迟加多端

livekit/agents 跟 LiveKit Cloud 深度整合。LiveKit Cloud 是基于 WebRTC 的全球低延迟(低于 200 毫秒)媒体服务器,业务方在 LiveKit Cloud 上跑 livekit/agents,前端用 LiveKit SDK(Web、iOS、Android、Flutter、React Native)接入,业务方不用自己部署 WebRTC 服务器,5 分钟搭一个生产级实时语音 AI 应用。

LiveKit Agents Playground

多 Agent 协作

一个会话里跑多个 Agent(主 Agent 加 工具 Agent 加 知识库 Agent),业务方用 LangGraph、CrewAI、AutoGen 编排多 Agent 协作,LiveKit 处理多 Agent 间的语音切换。

视频 AI

Agent 不仅能听能说,还能看(摄像头、屏幕共享),做实时视频分析、AI 面试、AI 监考。

工具调用加 RAG 加 MCP

livekit/agents 内置工具调用框架。业务方定义 function(tool),livekit/agents 自动把 function schema 喂给 LLM,LLM 决定何时调哪个 tool,livekit/agents 异步执行 tool 并把结果回填给 LLM。

工具调用模式

支持同步、异步、流式 3 种调用模式,业务方调外部 API(REST、GraphQL、gRPC)或数据库查询。

RAG 集成

业务方把企业内部文档、产品手册、FAQ 灌到 Pinecone、Weaviate、Qdrant 向量库,livekit/agents 自动在对话时检索相关文档喂给 LLM,LLM 给出基于企业内部知识的回答。

MCP 集成

业务方用 Model Context Protocol 把企业内部系统(CRM、ERP、Helpdesk)暴露成 MCP server,livekit/agents 让 AI Agent 直接调用,业务方用自然语言操作企业内部系统。

实战案例

客服行业(替代 60% 人工客服,响应时间从 30s 降到 1s)、医疗行业(初诊分诊)、教育行业(AI 口语陪练)、金融行业(投资顾问)。

部署加生态

livekit/agents 部署门槛低,pip install livekit-agents,5 行 Python 代码就能跑 demo。

LiveKit Cloud 部署

在 LiveKit Cloud 上部署生产环境,自动扩缩容到 1000 加并发会话,延迟稳定低于 200 毫秒。

自托管

在 K8s 集群跑 LiveKit 服务器加 livekit/agents workers,完全自主可控,数据不出企业内网,合规行业首选。

周边生态

项目速查

livekit 2026 开源实时语音 AI Agent 框架,多 LLM 加 STT 加 TTS 自由组合不被厂商绑定,WebRTC 全球低于 200 毫秒延迟,打断逻辑加多 Agent 协作加 RAG、MCP 集成,5 分钟搭生产级语音 AI 助手,2026 实时语音 AI Agent 事实标准