谷歌上周刚推出 Gemini 3.8 Live,这周就给它补上了一张脸。带 Live Avatar 功能的版本已在 Gemini Enterprise 上线,用户可以通过官方文档探索 API 开始使用。

这套功能把接近实时的视频生成和语音结合起来,让对话模型有了能倾听、观察、并以动态视觉形象交流的能力。精准唇形同步、自然表情、流畅的对话轮次切换,是它对外强调的三个关键词。

打开网易新闻 查看精彩图片

对话本来就是多模态的

谷歌在介绍里给了一个判断:对话本身天生就是多模态的,人们通过倾听、观察、说话和面部表情交流。Live Avatar 要做的,就是把这几项能力交给企业智能代理,让它同时处理视觉和音频输入,生成更丰富的对话。

除了视觉呈现,这套功能还依托 Gemini 的高级推理能力。通过异步工具调用,Live Avatar 可以在后台触发工具调用并获取数据,同时保持对话正常进行。处理复杂任务时,对话流程不会中断。

97种语言,唇形跟着变

Live Avatar 支持原生多语言语音同步,可动态适配唇形同步与表情,能在 97 种语言之间无缝切换,不会降低视频保真度或出现视觉偏移。这是这套方案里最直观的一项能力:换语言,嘴型跟着换。

形象来源上,谷歌提供了预设的多样化形象库,企业也可以自定义。开发者可通过高质量参考图像生成完整动画、响应灵敏的虚拟形象,同时保留参考形象的相似度、品牌风格与角色特征。目前自定义虚拟形象仅对企业白名单用户开放。

水印嵌进音视频里

安全机制方面,谷歌为 Live Avatar 构建了严格的安全保障,所有 AI 生成内容都通过 SynthID 添加隐形水印,直接嵌入音频与视频输出,帮助识别 AI 生成内容,减少错误信息和错误归属问题。

从产品路径看,谷歌这次把实时对话、视觉形象、多语言同步和工具调用打包进企业级入口,指向的是更具交互性的虚拟服务场景。