跟语音助手说话,最怕那种说完要等两秒才回话的尴尬。谷歌今天给出的新答案是:把推理塞进对话的间隙里。

谷歌发布了 Gemini 3.8 LiveGemini 3.8 Live Extended Thinking 两款语音模型,官方称这是其迄今最先进的语音处理模型。核心卖点有两个:接近实时的推理能力,以及边说话边思考的并行处理。

打开网易新闻 查看精彩图片

延迟是语音AI的老毛病

语音交互和打字交互的体验分水岭,就在响应速度上。文字输入慢一点用户能忍,语音对话里哪怕半秒的空白,都会让人觉得对面"卡住了"。

谷歌这次要解决的就是这个延迟问题。两款模型都指向同一个目标:让基于语音的AI代理在对话中不再有明显的停顿感。

两款模型,两种思路

从命名就能看出分工:

  • Gemini 3.8 Live:主打接近实时的推理,追求响应速度
  • Gemini 3.8 Live Extended Thinking:在实时之外留出更长的思考空间

后者对应的是"同时说话与思考"的能力——不是等用户说完再开始处理,而是在对话进行中同步推进推理。

语音代理的下一步

语音AI代理一直被延迟拖后腿。用户期待的是像跟人聊天一样的自然节奏,而模型的处理链路越长,这种自然感就越难维持。

谷歌把这两款模型定位为迄今最先进的语音处理模型,等于把竞争焦点从"能不能听懂"挪到了"能不能接得上话"。对做语音代理的开发者来说,这个方向的变化比参数本身更值得关注。