(AI云资讯消息)OpenAI 对 ChatGPT 的语音模式进行了重大升级,推出的新模型GPT-Live-1更像是在与真人交谈。如果用户在对话中途停顿,它也会等待用户继续说下去。
在媒体发布会上,OpenAI 研究负责人昆丹·库马尔(Kundan Kumar)称 GPT-Live-1 是该公司迄今为止最聪明的语音模型。当需要进行推理或搜索网络时,它会自动将用户的问题转交给其最强的文本模型(如 GPT-5.5),从而能更快地从研究用户所询问的话题,过渡到谈论其发现。升级后的模型还会在谈论天气、股票和体育等话题时,辅以 AI 生成的视觉图像,展示比分或本周天气预报等相关信息。
ChatGPT 此前依赖的是一个较老的、基于轮流对话的语音模型,它有时无法给出准确的回答,也难以维持自然的对话节奏。OpenAI产品负责人阿蒂·埃莱蒂(Atty Eleti)在发布会上表示:“这是一个全双工模型,它真正意味着可以同时听和说。从模型层面看,它能持续且同步地处理输入流并生成输出流。”
这种架构为 ChatGPT 的语音模式开启了新功能,例如实时翻译。现在,用户不需要等自己说完才能获得翻译,ChatGPT 可以在用户说话的同时进行翻译。也可以让 ChatGPT 语音助手先别说话,等用户叫它时再说,OpenAI 表示这在以前是做不到的。此外,它还会用“嗯嗯”、“是的”或“明白了”这样的词语来示意它在听。
OpenAI 指出,已内置了安全防护机制,能引导模型避免产生有害回复,或在高风险情境下完全终止对话。该模型经过训练,可在涉及自残的对话中提供经专家审核的危机热线支持,同时也会为青少年提供与其年龄相符的回应。
GPT-Live-1在 iOS、安卓及网页端逐步上线,将为 Go、Plus 和 Pro 订阅用户的 ChatGPT 语音功能提供支持。而一个更轻量、更高效的 GPT-Live-1 mini 模型,将作为免费用户的默认选择。
热门跟贴