随手先关注,不错过每日AI热讯速递
①
9 月 24 日,谷歌官宣Gemini 3.8 Live with Live Avatar:给对话式 AI 装上一张能实时说话的「脸」,即日起在Gemini Enterprise平台可用[1]。
谷歌把它概括为——「creates an experience that listens, sees, and speaks」——让 AI 以动态视觉形象陪你听、看、说[1]。
图来源:谷歌官方博客[1]
这不是换个动画头像那么简单:Live Avatar是把视频生成原生耦合进语音模型,而不是外挂一套渲染管线——延迟被压到对话可接受的水平,才是「实时」二字的门槛[1]。
②
能力拆开看是三件事。第一是口型同步:精确唇形、自然表情、流畅对话轮替,官方强调这三点让企业虚拟服务「更具交互性」[1]。
第二是多语言:支持97 种语言之间无缝切换——「without degrading video fidelity or introducing visual drift」——切换语言时视频保真度不掉、脸上也不出现漂移[2]。
第三是边聊边干活:对话持续的同时,智能体可在后台异步执行工具调用与数据获取,处理多步骤业务时不再「死机式等待」[1]。
安全侧有双保险:所有输出都织入SynthID(谷歌的不可见数字水印技术,直接嵌进音频与视频,用于标记内容由 AI 生成)水印,保证 AI 生成内容始终可检测[1];从参考图定制专属头像的能力,目前只对企业白名单开放[2]。
从高质量参考图生成完全动画化的自定义头像,目前只经企业白名单提供[2]。
③
它不是孤立发布。上周谷歌刚推出Gemini 3.8 Live模型本身,主打近实时处理视觉输入;本次的 Live Avatar 是在语音底座上叠加的可视化层[2]。
本次发布把视频生成、语音交互与工具调用合进同一条实时体验:用户继续对话时,智能体仍可在后台执行多步任务[1]。
相比只输出语音,Live Avatar 新增了可见的口型、表情与动态形象;谷歌把客服、产品演示和信息服务列为主要企业场景[1]。
产品目前只在 Gemini Enterprise 开放,自定义头像能力另受企业白名单限制[1][2]。
④
真正值得掂量的是风险侧。能给 AI 一张实时生成的脸,就意味着深度伪造(用 AI 伪造真人音视频的技术,常被滥用于诈骗与冒名)的门槛又降了一截——这正是 SynthID 水印被织进输出的原因[1]。
定制头像的白名单制是第二道闸:企业想复刻某个真人面孔,目前绕不开谷歌的审核[2]。
谷歌对速度的公开表述是「近实时」,而不是零延迟;这意味着真实业务部署仍要检验网络、工具调用与视频生成叠加后的体验[1]。
对企业用户来说,虚拟客服、导览、kiosk 终端是首发场景;相应的身份冒用与内容标记问题,也会随着头像更逼真而更突出[1][2]。
欢迎在评论区聊聊:如果 AI 客服有了会看会说的脸,你是更愿意开口,还是更警惕了?
参考来源:
[1] Introducing Gemini 3.8 Live with Live Avatarhttps://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/
[2] Gemini 3.8 Live with Live Avatar gives Google's AI a facehttps://www.theverge.com/tech/1000328/google-gemini-ai-live-avatar-face
欢迎点赞、分享、推荐
一起拥抱AI
热门跟贴