编辑|张倩

最近两天,相信大家都被 GPT-6 Astra 的各种逆天玩法刷屏了 —— 一句话完成 3D 建模、从零制作完整游戏、几千个零件的东西说拆就拆,甚至还能拿来控制机器人…… 总之,强得没边。

网友们有句话说得很夸张:只要你学得慢,你就可以不用学。但是 GPT-6 Astra 确实给人一种感觉,它一出来,原来困扰很多领域的复杂性突然就有解决的苗头了。

这种趋势不容小觑,但模型现阶段的能力也不宜过度夸大。在这篇文章中,我们就来盘点一下 GPT-6 Astra 的各种逆天玩法,及其当前的局限。

3D 建模这件事,

突然开始变简单了?

这两天 Astra 最密集刷屏的能力,大概就是 3D。

有人拿它来直接生成 3D 的火车:

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

两列火车都是 Astra 用 TypeScript 和 Three.js 代码,在浏览器运行时直接生成出来的。车身尺寸、轮廓、各种几何结构来自代码里的尺寸参数、profile 和 geometry function;车轮运动是代码,整辆火车炸开、零件散开再重新组装的动画也全是代码。

而且,这些模型做出来之后还能按部件拆开。一台相机可以被拆成 122 个组件组、1877 个独立建模部件。整个任务大概跑了 3 个小时,作者表示之前根本没意识到 Three.js(一个用于在浏览器中创建和展示 3D 图形的 JavaScript 库)还能这么玩。

打开网易新闻 查看精彩图片

相机能拆,特斯拉也能拆。有人将其拆成了 334 个建模部件,而且这 334 个零件的名称、编号和基础结构是有官方依据的,不是 AI 凭空捏造的。当然,它仅仅是一个非常粗略的框架级拆解,远远达不到 3D 拆解所需的精细度。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

有意思的是,这个作者拆完特斯拉不过瘾,还建了个网站来「拆人(男性)」:全身的 2234 个建模部件可以逐一查看,而且可以映射到源文件。

打开网易新闻 查看精彩图片

看到这些案例,有人高呼「3D 建模的学生天塌了」。

打开网易新闻 查看精彩图片

但也有人说,AI 现在直出的结果还不能商用。

打开网易新闻 查看精彩图片

而且,稳定性也是一大问题,它终究还是需要人来修 bug 的。

打开网易新闻 查看精彩图片

这些 Demo 的意义,并不只是证明 Astra 会建模。更重要的是,它展示了一种新的交互方式:人不再需要学习复杂的 3D 软件,而是直接描述想要的世界,让 AI 负责把想法翻译成空间结构。

过去,3D 建模是进入数字世界的门槛;未来,它可能变成 AI 理解和生成现实世界的一种基础能力。当然,距离真正工业级应用还有距离,但这条路正在变得越来越清晰。

软件不用学了?

Astra 自己进去点

在 OpenAI 的官方定位里,computer use、browser use 都是 GPT-6 Astra 的王牌能力。在一个 Canva 绘画案例中,我们看到了这方面的真实体现。

在这个案例中,网友让 Astra 在 Canva 里把他画出来(根据参考照片复刻肖像)。画图过程中,Astra 能够直接操控浏览器中的 Canva 界面:选择工具、精确点击 / 拖动、逐层绘制(从背景到身体、手臂,再到脸部细节),最终完成一张高度相似的像素风格半写实肖像。

打开网易新闻 查看精彩图片

这里面还涉及长时间多步骤操作(作者反馈约 1 小时)、工具切换(Chrome 中途出问题后切换到 computer use 模式),以及极高的界面理解与精细控制精度。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

隔壁 fable 5.1 也拿到了相同的提示,但结果让网友略显失望:

打开网易新闻 查看精彩图片

做这个实验的还不止他一个人。另一个网友也拿同一张照片让两个 AI 画,结果也差不多:Astra 更写实,Fable 5.1 更洒脱……

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q

不过,有网友指出,这些东西的最终视觉效果不是重点,重要的是有 Astra 加持的 Agent 已经能够自己操作 Blender、虚幻引擎、浏览器,把 prompt 直接变成工程文件。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

这几天刷屏的「Astra 使用 Blender 重建旧金山艺术宫」「张老蒸汽火车图纸,变成 Blender 里的 3295 个可编辑对象」「600 个 Astra Agent 住进同一个 Unreal 世界」都是这一方向的典型案例。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q

另一个比较有意思的案例是「弹钢琴」。OpenAI 员工 Victor E. Nunez 让 Astra 找一个在线钢琴,用 Computer Use 弹《River Flows in You》。在执行过程中,Astra 自己搜索并打开了一个在线虚拟钢琴网站,然后用 Computer Use 直接操控电脑界面:鼠标点击当作「右手」,点击钢琴键。键盘控制当作「左手 + 快速段落」。两者同时进行,精确控制节奏、音符时值,完整演奏了《River Flows in You》这首曲子。

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q

更有意思的是,Astra 自己录了屏幕,并剪辑了这个演示视频。整个过程是端到端的:从理解任务 → 找网站 → 加载乐器 → 实时演奏,无需人工干预中间步骤。

这些案例表明,GPT-6 Astra 在 agentic computer use 上达到了新的高度,速度、精度、多工具并行和实时反馈能力都达到了相当高的水平。

或许,以后人们可以不执着于想怎么把某个专业软件的能力重新做成 AI 功能,直接把软件交给 AI 用就行了。能够操作任何为人类设计的软件,大大扩展了 AI 的应用场景。

屏幕之外,

Astra 开始控制机器人

前面的 Demo 再离谱,本质上还都发生在电脑里。

网友 Jay Chooi 做的测试就不太一样了:他们真的把 Astra 接到了机械臂上。

打开网易新闻 查看精彩图片

其中一个任务,是让机械臂把积木放进碗里。GPT-6 Astra 做了 20 次,成功率达到 95%;对照的 Fable 5.1 是 40%。同时,其输出 token 数仅为后者的约 16%,成本仅为后者的约 43%。

更关键的是,这里没有针对这个任务给 Astra 做示范或者微调。Jay Chooi 后来专门补充,这是一个 zero-shot 测试。模型负责给出机械臂末端执行器的位置和姿态,再通过自动逆运动学求解器转换成机械臂动作。

随着大模型 token 输出速度的加快,Jay Chooi 乐观预计,LLM 最早今年年底就能实时控制机械臂,最迟在 2029 年。

打开网易新闻 查看精彩图片

英伟达前研究科学家 Yu Xiang 则进一步指出,机器人学的下一个前沿可能是如何真正利用先进的 AI 模型来进行操控。仅仅将它们用作调用感知和规划模块的 Agent 是不够的。我们需要新的方法来将这些模型与物理世界连接起来。

打开网易新闻 查看精彩图片

这样的结果也让人好奇,OpenAI 到底在后训练里加了什么,才让模型这么全能?还是说预训练有所突破?

打开网易新闻 查看精彩图片

还学吗?

看了这些,有人感叹,AI 已经不满足于生成一张图,而是开始试着「重构世界」了。

打开网易新闻 查看精彩图片

一个问题自然浮出水面:当 AI 能建模、能写代码、能操作软件,甚至开始碰物理世界,我们今天苦学的这些技能,到底还有多少会以现在的形态存在?

打开网易新闻 查看精彩图片

这个问题现在当然没有答案。Astra 还有大量不稳定、粗糙甚至根本不能用的地方,但这两天真正让人不安又兴奋的,可能也正是这一点:很多过去默认必须由人掌握的复杂操作,第一次出现了被整体打包给 AI 的可能。

至于「以后还要不要学」,答案肯定是还得学。只是我们可能得重新想想,到底什么才值得学。