三个月前,Dwarkesh发布了一段关于RLVR的视频随笔,其中提出的一个框架性问题,让不少做Computer Use的人感到不满。这种公开学习、在大平台上说错话的压力,做这行的人都不陌生。
但就在OpenAI DevDay当天,Computer Use团队的产品与工程负责人Ari Weinstein给出了一个截然不同的判断:Computer Use和几个月前相比,已经是"180度不同"。
从Sky到自我调试的智能体
Ari Weinstein是Sky的联合创始人,如今在OpenAI负责Computer Use方向的推进。他提到,现在的智能体在调试和从失败中恢复这件事上,能力已经明显不同以往。
过去智能体遇到报错往往就卡住了,现在它们能自己排查问题、尝试恢复。这个变化直接决定了智能体能不能真正完成一整条任务链,而不是走到一半就停摆。
在感知和操作软件的方式上,Computer Use也不再只依赖单一输入。截图、无障碍树、DOM、Playwright以及生成的代码,这几样东西被组合在一起使用,改变了整个速度方程。
App Shots是其中一个具体功能:它能把用户电脑上正在进行的操作上下文,快速带进Codex和ChatGPT。相比普通截图,这种方式给模型的上下文要丰富得多。
比人快,然后呢
Ari Weinstein给出的下一个判断是:Computer Use现在完成某些任务的速度,已经能超过普通人。而再往前一步的目标,是让智能体在使用软件这件事上达到"字面意义上的超人水平"。
这个路径被拆成了两段:先追平人类水平,再超越。目前处在第一段已经跑通、第二段刚开始的位置。
DevDay上同步发布的还有Dots,一个个人助理产品,带有Computer Use相关功能。GPT-6.1 Sol则是新模型,Ari Weinstein特别提到它在Computer Use场景下的成本和速度优势——按他的说法,成本是Astra的五分之一,如果单看Computer Use场景,则是七分之一。
Agents API现在也把Computer Use包含进去了。这意味着开发者可以直接在Codex和ChatGPT所用的同一套Computer Use能力上做开发,而不用自己从零搭一套。
Mac上的原生Computer Use也做了演示:Roman让系统自动截取自己应用的截图,同时他还能在电脑上做别的事情。
当智能体能够操作网站、甚至发起支付时,信任、权限和安全就成了绕不开的问题。这也是Agents API在设计时需要处理的一环。
另一个被反复提到的方向是闭环:Computer Use能把写软件和测试软件这两件事连起来。写完之后直接跑、直接验证,而不是写完再人工切到另一个环节去测。
从被质疑到被拿来和人类速度做比较,Computer Use这三个月的变化,核心不在于某一个功能的上线,而在于智能体终于开始具备"出错之后自己爬起来"的能力。
热门跟贴