OpenAI发布了GPT-6 Astra,技术圈又开始了熟悉的跑分仪式。ARC-AGI-3拿到99.9%,OSWorld 2.0拿到72.6%,这些数字确实够猛,看起来像是能力层面跨进了新阶段。但能力变强,不等于AI的本质变了。

这次发布的核心卖点是“代理”——Astra不只是输出文字,它能接管你的电脑。宣传片里,一个人对着大屏幕用语音指挥一个代理干活,表单自动填充、表格自动生成、草图实时绘制。OpenAI的广告语是:“你在电脑上能做的任何事,Astra都能替你快速完成。”

打开网易新闻 查看精彩图片

广告里的“新纪元”感

这句广告语听起来更像能量饮料的文案,而不是科技公司的。它完全瞄准那种自信、精确、清楚自己要什么的用户,但大多数用户并不是这样。广告拍得确实好,专门营造一种“新时代来了”的感觉。可对懂技术的人来说,现实很快会泼一盆冷水。

Astra到底怎么操控电脑

在OpenAI的发布视频里,Astra操作电脑的方式跟你我一样,看起来自然又即时。但实际背后是一套复杂的动作循环:Astra先截取桌面画面,在一个像素坐标网格上操作,多模态视觉编码器把这些像素转成token,解析出界面布局、图标边界、光标位置和可访问性树。

接下来,它预测的不是文章里的下一个词,而是坐标和工具调用,比如鼠标移动、左键点击、按下快捷键。操作系统层的客户端接收这些函数指令,驱动原生桌面接口去点击按钮、拖动滑块、在动态网页元素或画布元素里输入内容。简单说,Astra截一帧画面,跟自己的预期做视觉比对,然后循环。

广告想把它包装成一个住在操作系统里的自主实体,但它不是。它依然完全建立在语言处理和LLM之上。

“LLM大脑”的陷阱

AGI爱好者一直承诺一件事:自主性。系统能在大多数有经济价值的工作上超过人类,不需要回来找我们要反馈,也不需要把人留在决策闭环里。Astra被营销成满足这个定义的原型。

但本质上,我们仍然只是把一个“预测下一个token”的模型绑到了鼠标驱动上。让代理循环跑得更快、给它循环推理步骤、扩大上下文记忆,这些都不会改变架构的核心病理,也不会变出什么魔法。

跑分再高,Astra依然是一个被语言模型驱动、靠视觉比对和坐标预测来操作桌面的系统。它能替你点按钮、填表格,但离“不需要人类反馈、自主完成经济价值工作”的AGI定义,还隔着一条没有跨过去的线。