一个从没摸过三维软件的用户,坐在Windows电脑前,只是往聊天框里输入了一句话。接下来发生的事让整个科技圈子都炸了锅——屏幕上自动弹出下载进度条、安装向导、权限确认窗口,然后Blender冰冷复杂的界面被一个看不见的手操作着,建模、贴图、绑定骨骼、渲染动画一气呵成,最后输出了一个活灵活现的3D水獭循环动画。中间唯一需要人类插手的,就是点了一次鼠标,同意Windows那个“是否允许此应用修改设备”的弹窗。
这是@emollick在X平台发布的OpenAI Codex计算机使用模式实测视频里的真实流程。用户在帖子中明确强调,自己此前没有任何Blender经验,完全是零基础开局。Codex不仅自己动手下载并装好了Blender,还在没有任何事先训练过这个具体软件的情况下,趟过了安装向导里会随机出现的各种对话框、权限提示和界面布局,接下来直接操控Blender的UI,完成了从三维网格生成到纹理贴图再到骨骼绑定、动画循环渲染的完整管线。
这条演示迅速成为科技圈顶流,因为它的突破点在于把智能体从“浏览器里填表”“沙盒里跑代码”直接拉到了“真刀真枪操作桌面应用”的量级。此前Anthropic在2024年10月推出的Claude 3.5 Sonnet计算机使用beta版,以及谷歌同年12月亮相的Project Mariner,都还局限在网页浏览和表单操作上。而Codex这次迈过了软件安装这道历来需要管理员权限、需要动态应对平台特定报错信息的硬门槛,相当于一个AI不光能操作现有软件,还能帮你先把软件工具链搭起来。
对AI工程师来说,这里面最硬的信号是模型在没有针对Blender做专门训练的情况下,依然能泛化处理安装过程中出现的各种非预置窗口。这说明底层的视觉-语言-动作模型是在桌面环境这个层级做了跨应用的理解,而不是靠死记硬背几个常用软件的界面布局。这也意味着,工业设计里那些需要用CAD、视频剪辑软件、数据分析套件等专业工具的工作流,很可能会因为这类能力而彻底压低上手门槛,变成一句自然语言指令就能启动的自动化任务。
当然,硬币的另一面是安全问题。自主安装软件的能力一旦放开,就等于给AI打开了不经人工审核就能改动系统的通道。这是桌面级智能体走向真正生产力工具前,厂商和开发者必须跨过去的一道坎。目前OpenAI并未透露Codex的计算机使用模式是已经在公开API中可用,还是仍处于内部测试阶段,演示中所用的模型版本——大概率是GPT-4o或者某个专门的Codex变体——也没有官方的进一步说明。后续可以紧盯OpenAI的下一次开发者更新,以及Anthropic、谷歌会不会拿出类似的桌面应用操控演示来对标。
热门跟贴