CyberVerse:一张照片,让数字人实时“活”过来

CyberVerse 是一个开源数字人智能体平台,主打“一张照片+实时视频通话”。你只需上传一张照片,就能生成一个能听、能说、能看见你的AI数字人——就像打造属于自己的J.A.R.V.I.S.,或者让思念之人再次微笑。

打开网易新闻 查看精彩图片

它解决了什么痛点?

传统方案要么是预录视频,毫无互动;要么回合制对话,延迟高且不自然;要么依赖3D建模、动作捕捉,门槛极高;还有不少闭源收费,无法自定义。CyberVerse 的思路是:一张照片 + 开源代码 + GPU ≈ 低延迟实时数字人。首帧约1.5秒,底层走WebRTC。

演示:

打开网易新闻 查看精彩图片

模块化设计(各组件可插拔)

核心能力

- 实时视频通话(WebRTC + P2P + TURN/NAT穿透)

- 一张照片生成数字人(面部动画+口型同步+待机呼吸感)

- 数字人具备Agent能力(可接工具、执行任务)

- 模块化设计:大脑(LLM)、声音(TTS,支持豆包语音克隆)、听觉(ASR)、面孔(FlashHead/LiveAct)均可插拔替换

- 支持语音/文字混合输入、打断说话、用户摄像头输入、屏幕共享,以及会话历史持久化

路线图亮点:跨会话长期记忆、工具调用、知识库RAG、多智能体协作、直播推流、Web组件/SDK嵌入。

**两套模型对比**

两套模型的区别

FlashHead 1.3B

LiveAct 18B

参数量

1.3B

18B

画质

有Pro/Lite档

更自然

最低可跑硬件

RTX 4090(Lite档)

RTX PRO 6000

适合场景

算力有限时

追求质量时

与同类产品的差异

跟同类产品的区别

对比维度

CyberVerse

HeyGen / D-ID等商业产品

其他开源方案

是否开源

✅ GPL v3

❌ 闭源

部分开源

实时交互

✅ WebRTC实时

多为异步生成

少见

一张照片建人

门槛较高

Agent能力

✅ 规划中/部分已有

极少

自部署

部分支持

费用

仅GPU成本

按分钟/按量收费

不一

硬件门槛

高(需要GPU)

无(云端)

不一

适合哪些人?

- AI开发者/研究者:代码结构清晰,YAML配置灵活

- 有GPU资源的独立开发者:自建私有化数字人服务

- 内容创作者:创作带有特定角色的互动内容

- 情感陪伴探索者:想“复现”某人或虚构角色

- 企业私有化部署:数据不上云,完全自控

不适合哪些场景?

- 没有GPU的普通用户:最低RTX 4090(Lite档),消费级设备跑不动

- 非技术用户:安装涉及Python/Go/Node/conda/protoc/FFmpeg等多依赖

- 只需简单生成视频:HeyGen等性价比更高

- 极致画质商业项目:开源模型与顶级商业方案仍有差距

- 多语言ASR/TTS需求:主要依赖豆包语音,非中文场景文档不清晰

- 低延迟手机端/边缘部署:当前架构为服务器GPU设计

技术前瞻与思考

WebRTC + GPU推理的实时链路是核心竞争力,可延伸至远程医疗、AI面试官、虚拟客服等。多智能体网络(路线图第三阶段)最具想象力——数字人之间可相互协作。

“思念之人”场景值得关注,已有商业产品做“AI复活”服务,CyberVerse将其开源化,伦理讨论将随之而来。未来Web组件/SDK上线后,接入门槛将大幅降低,生态可能快速扩张。

当前最大瓶颈是GPU成本,但随着推理效率提升和消费级GPU进步,门槛会逐渐降低。另外,对豆包语音的依赖是潜在风险——若字节调整API政策,会影响核心功能。