谷歌一次性端出两个新模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。名字长,但指向很明确——实时语音交互。
两个版本,两种思路
打开网易新闻 查看精彩图片
标准版主打实时响应,Extended Thinking 版则把推理能力拉进来。官方说法是,两者都在三个维度上做了增强:推理、视觉锚定、多步任务完成。
- 推理:不只是听懂,还要想清楚
- 视觉锚定:语音之外,看得见上下文
- 多步任务:一句话交代,分几步办完
开发者先受益,消费者跟着用
这两个模型同时面向开发者和普通用户。对开发者来说,多了一个能接进实时语音场景的选项;对消费者来说,语音助手的反应和办事能力会往上走一个台阶。
实时语音这条赛道,过去拼的是延迟和自然度。现在谷歌把推理和多步任务塞进来,等于把竞争维度换了——语音不再只是问答,而是能连续办事。
热门跟贴