谷歌推出最先进实时音频模型
i黑马
·北京
·《i黑马》官方网易号
谷歌把旗下Gemini模型的战场从文字和代码推进到了实时语音。当地时间9月15日,谷歌宣布推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时音频模型,并称这是其目前最先进的实时对话模型。两款模型不仅可以进行更加自然、流畅的语音交流,还能在对话不中断的情况下调用工具、处理视觉信息和执行复杂任务。
这意味着,谷歌正在尝试让实时语音AI从此前的“语音版聊天机器人”,进一步变成能够听懂、思考、调用工具并把事情做完的语音智能体(Agent)。
打开网易新闻 查看精彩图片
热门跟贴