跟语音助手说话,最怕那种说完要等两秒才回话的尴尬。谷歌今天给出的新答案是:把推理塞进对话的间隙里。
谷歌发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音模型,官方称这是其迄今最先进的语音处理模型。核心卖点有两个:接近实时的推理能力,以及边说话边思考的并行处理。
打开网易新闻 查看精彩图片
延迟是语音AI的老毛病
语音交互和打字交互的体验分水岭,就在响应速度上。文字输入慢一点用户能忍,语音对话里哪怕半秒的空白,都会让人觉得对面"卡住了"。
谷歌这次要解决的就是这个延迟问题。两款模型都指向同一个目标:让基于语音的AI代理在对话中不再有明显的停顿感。
两款模型,两种思路
从命名就能看出分工:
- Gemini 3.8 Live:主打接近实时的推理,追求响应速度
- Gemini 3.8 Live Extended Thinking:在实时之外留出更长的思考空间
后者对应的是"同时说话与思考"的能力——不是等用户说完再开始处理,而是在对话进行中同步推进推理。
语音代理的下一步
语音AI代理一直被延迟拖后腿。用户期待的是像跟人聊天一样的自然节奏,而模型的处理链路越长,这种自然感就越难维持。
谷歌把这两款模型定位为迄今最先进的语音处理模型,等于把竞争焦点从"能不能听懂"挪到了"能不能接得上话"。对做语音代理的开发者来说,这个方向的变化比参数本身更值得关注。
热门跟贴