7月24日,OpenAI宣布旗下的ChatGPT桌面应用迎来重要升级,正式上线由GPT-Live模型驱动的ChatGPT Voice模式。这次更新把聊天、办公和编程三个板块整合到一起,用户只需用自然语音发起、检查或调整任务,便能实现多线程的工作协同。

与早期仅支持语音识别的版本不同,此次引入的GPT-Live模型实现了全双工语音交互,意味着AI可以同时聆听和说话,对话感觉更接近真人交流。OpenAI在2024年为ChatGPT首次加入语音识别后,便持续加大语音技术的投入,而这一次的升级直接将语音从辅助输入方式变成了贯穿整个工作流的控制中枢。

打开网易新闻 查看精彩图片

根据OpenAI的官方声明,公司正朝着一个更自然的交互愿景前行:“未来用户只需口述需求,ChatGPT就能根据你的思路,快速推进多项任务。”新版ChatGPT Voice能够从单一对话中启动多个工作流程,并且在这些任务交由智能体后台执行时,用户仍然可以继续与AI进行其他对话,也就是说,思考和执行可以异步进行,互不阻塞。

一个典型的场景是规划商务旅行。当你冲咖啡或处理其他事务时,对着电脑嘱咐一句,ChatGPT就会自动检查你的日历是否有冲突,梳理收件箱里航班变动的邮件,并准备会议记录。整个过程不需要来回切换窗口或手动输入指令,语音成为统一的入口,背后是模型在多任务之间调度和整合信息的能力。

此次桌面应用与Codex整合后,编程场景同样被纳入语音协作的范围。开发者可以通过语音下达调试指令、查找代码问题,而不必中断敲击键盘的思路。三个板块的融合意味着,办公、社交和开发等不同场景的边界正在被一种更无缝的交互方式软化,语音不单是提问题的工具,更是协调生产线的核心管道。

从单一问题应答到多线程任务推进,ChatGPT桌面版的变化反映出语音交互正从“一问一答”走向“意图驱动的工作流管理”。虽然目前体验仍受限于桌面应用环境,但口述需求、AI主动推进多项事项的模式,已经为个人效率工具的形态提供了一个新的参照。