随手先关注,不错过每日AI热讯速递

当地时间9 月 15 日,Google 发布两款实时语音对话模型:Gemini 3.8 LiveGemini 3.8 Live Extended Thinking[1]。

它们都不是「语音转文字—大模型—文字转语音」的拼接方案,而是原生语音到语音模型,直接跑在 Gemini Live API 上[1][4]。

分工很清楚。Gemini 3.8 Live面向规模部署与成本效率,负责流畅对话、视觉理解与后台工具调用[1]。

Extended Thinking面向高复杂度任务,多步推理更强,而且可以在说话的同时推理[1]。

打开网易新闻 查看精彩图片

图来源:Google DeepMind 官方博客[1]

Artificial Analysis的语音到语音质量指数给出了具体成绩:Extended Thinking 以82.6拿下总榜第一[1]。

智能体任务完成度方面,它在τ-Voice上得68.6%,在 Sierra 的τ-Voice-banking基准上得35.1%;推理维度上,Big Bench Audio得分97.7%[1]。

Gemini 3.8 Live 的位置也不低——Speech Agent Arena排名第二,官方对它的定位是规模与成本效率[1]。

在 ServiceNow 的EVA-Bench上,Google 称这两款模型推高了复杂工作流的帕累托前沿,也就是在准确性与对话质量之间取得了更好的平衡[1][3]。

打开网易新闻 查看精彩图片

图:Google 本次发布的两款 Gemini 语音模型(来源:MarkTechPost[3])

产品层面真正的变化是交互范式。Extended Thinking 提供「let me check that…」这类早期口头提示,也就是「让我确认一下」,用一句话先接住请求,再继续推理[1]。

随后它用实时进度旁白,把多步后台任务的过程讲给用户听;工具调用与接口请求在后台执行,对话全程不中断[1]。

Gemini 3.8 Live 能近实时处理视觉输入,还能在对话中途自动检测并切换97 种支持语言[1]。

Google给出的演示有两个:把草图加语音反馈直接转成可运行的 React 组件;以及协调一次多步骤的预订流程[3]。

SynthID(Google 为 AI 生成内容嵌入的不可感知水印,用于后续检测与溯源)覆盖全部生成音频,这是可追溯性的合规底座[1]。

价格是这一轮最直接的武器。两款模型定价均为音频输入$0.005/分钟、音频输出$0.018/分钟[3]。

按官方折算口径,这来自$3/百万输入 token 与$12/百万输出 token 的定价[3]。换算成更直观的口径,每小时语音对话约 $1.38[4]。

对比对象很明确:这个价格显著低于 OpenAI 的 GPT-Live-1;不过 GPT-Live-1 支持全双工(双方可以同时说话、不必等对方说完的对话方式,更接近真人交流),听感上可能仍更自然[4]。

上线节奏是分层的:开发者侧即日起进入 Gemini API 与 Google AI Studio,企业侧在 Gemini Enterprise 先做私有预览,面向所有人的入口是Search Live[1]。

生态侧同时铺开。AgoraLiveKitPipecatVercel等实时媒体集成方通过 Gemini Live API 提供现成的语音驱动界面基础设施,开发者不必自建流式传输[2]。

语音助手做了十年,卡点一直不在识别准确率,而在等待。把推理和发言并行,等于把「等待回复」这段时间从产品体验里删掉了。

语音智能体的成本已经压到每小时一美元出头,你觉得这类产品会先在哪个场景跑通?欢迎在评论区分享你的判断。

参考来源:

[1] Google DeepMind: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinkinghttps://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/

[2] Google Blog: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinkinghttps://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

[3] MarkTechPost: Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice Agentshttps://www.marktechpost.com/2026/09/15/google-releases-gemini-3-8-live-and-3-8-live-extended-thinking-for-production-grade-voice-agents/

[4] The Decoder: Google launches Gemini 3.8 Live to take on OpenAI's GPT-Live-1 at a fraction of the costhttps://the-decoder.com/google-launches-gemini-3-8-live-to-take-on-openais-gpt-live-1-at-a-fraction-of-the-cost/

欢迎点赞、分享、推荐

一起拥抱AI