★ 设为星标 | 只讲人话,带你玩转AIGC。
OpenAI 今天为 ChatGPT 桌面端上线了实时语音功能。
现在我们可以直接通过声音控制电脑,并指挥 ChatGPT Work 或 Codex 中正在运行的多个 Agent。
这项能力底层就是前不久推出的 GPT-Live。
它不只是把语音转换成文字,而是可以一边听你说话,一边理解任务、协调 Agent 工作,再通过语音随时汇报进度。
用在 Codex 上,体验会非常直接。
以前写代码,需要坐在电脑前不断输入提示词、查看运行结果、补充需求。现在只要戴着耳机,就可以在房间里随时和 Codex 对话:
“刚才的报错解决了吗?”
“把首页改成深色模式。”
“测试通过后帮我提交代码。”
Codex 会继续在后台运行。
你可以离开电脑去做饭、打游戏,甚至上厕所,同时通过语音查询进度、修改要求,或者安排下一步任务。
除了能“听”,Codex 现在也能“看”了。
新版加入了 Appshots 功能,可以读取当前活动窗口的画面和文字。
看到报错页面时,不需要再截图、复制代码、解释上下文,直接问一句“这个问题怎么解决”就行;看到一个网页,也可以直接让它按照当前界面修改。
语音负责把想法说出来,Appshots 则负责把屏幕背景补充完整。
很多以前需要反复描述的细节,现在一句“把这里改一下”,Codex 就能知道你说的是哪里。
更重要的是,语音输入可能比键盘更适合复杂任务。
前 OpenAI 研究员、特斯拉前 AI 负责人 Andrej Karpathy 最近分享了一种使用大模型的方法:当一件事很复杂,又懒得把所有背景逐字打出来时,他会直接打开语音,连续说上十分钟。
哪怕表达很乱、想到哪里说到哪里,大模型也往往能够从这些漫无边际的描述中,还原出真正的目标,并把纠缠在一起的想法重新整理清楚。
有时,他还会把这个过程变成一场几轮的小型访谈,让模型继续追问。
这恰好解决了人与 Agent 协作中的一个核心问题:很多时候,不是模型能力不够,而是人提供的上下文太少。
键盘会迫使人压缩表达,很多背景、顾虑和临时想法还没写出来,就已经被自己删掉了。语音则可以用极低的成本,把脑子里的东西全部倒出来。
(如果你用过语音输入法,就会明白我说的这种感觉)
再加上 Appshots 提供的屏幕信息,Agent 对任务的理解会完整得多。
所以,这次更新不只是给 Codex 增加了一个麦克风和截图入口。
它意味着 vibe coding 正在从“用自然语言写代码”,进一步走向“把脑子里的想法和眼前的画面,直接交给 Agent”。
未来人与 AI 协作的主要输入设备,可能真的不再只是键盘,而是你的嘴和屏幕。
热门跟贴