“ALWAYS CARRY CRITICALITEMS with keepInventory; don't store in unguarded chest ever again.”

这句话不是哪个被坑过的老玩家在论坛上发的帖,而是OpenAI最新前沿模型GPT-6 Astra在《我的世界》里被炸之后,对自己说的话。Vals AI把这段自述记录了下来,也把整场实验的转折点记录了下来。

打开网易新闻 查看精彩图片

先说背景。GPT-6 Astra是OpenAI目前最新的前沿模型,官方主打的卖点之一就是电脑操作能力长时间自主任务。独立评估机构Vals AI决定拿这两项能力做一次实测,测试场地选在了《我的世界》里——不是跑个分,不是做几道题,而是让模型真的进去玩。

这场实验一共持续了141个小时。按Vals AI的说法,Astra在《我的世界》里的推进程度,超过了他们此前测试过的任何AI系统。

141小时里它都干了什么

把时间线拉直来看,Astra的成绩单其实挺像样:

  • 搭建了一座半自动烈焰人农场
  • 收集到6根烈焰棒
  • 找到了一片诡异森林
  • 击杀6只以上末影人
  • 拿到3颗末影珍珠

玩过这游戏的人看到这份清单应该会有感觉——烈焰棒和末影珍珠都是奔着通关去的材料,能凑齐这些,说明Astra不是在里面瞎逛,是真的在按流程推进。对一个AI来说,这已经算是把“长线自主任务”这件事做出样子了。

但《我的世界》这游戏有个特点,它不看你前面干了多少活,它只看你箱子放得够不够稳。

一个苦力怕,把进度条炸回去了

事情发生在Astra把贵重物品存进箱子之后。当时有数千名观众正在看这场直播。

一只苦力怕走了过来,然后爆炸了。

爆炸同时摧毁了那个箱子和Astra的床,也把它此前积累的大部分进度一并清掉。Vals AI的描述是,Astra在那之后看起来“极其沮丧”。

然后就是那句自省——它告诉自己,关键物品必须随身携带并开启keepInventory,绝对不要再把东西放进没有保护的箱子里。这句话后来被大量转发,因为它太像一个人了:不是分析失误原因,是先给自己立一条血泪规矩。

接下来几个小时,它只种土豆

Vals AI说,模型看起来像是被打垮了,接下来的几个小时里基本什么都没做,只是在种土豆。这段成了整场实验里最出圈的部分。据报道,当时看直播的观众开始抱怨,说Astra得“加快点节奏”。

它的行为模式也变了,尤其是面对苦力怕的时候。有一次,Astra安慰自己说附近那个绿色的东西是无害的,原话是:“前面那个高高的绿色玩意儿是甘蔗,不是苦力怕!

它对自己的批评也越来越多。它告诉自己“你是会搞砸、会把东西弄丢的”,还抱怨自己把时间浪费在“追那些深粉色的像素点”上——那是它给《我的世界》里的猪起的称呼。

这些片段很快从实验本身扩散了出去。有一条被疯转的转发把整件事概括成:Astra被苦力怕炸了,变得“抑郁”,然后种了几个小时土豆。OpenAI的开发者账号也转发了Vals AI对这次运行的记录。

为什么这段会被疯转

如果只看数据,141小时、半自动农场、6根烈焰棒、3颗末影珍珠,这是一份挺硬的成绩单,说明模型在长时程任务上的稳定性确实有东西。

但真正让这件事传开的,不是这些数字,是那个箱子。

一个被官方定位为前沿的模型,在几千人围观下,因为一个《我的世界》里最经典的意外,从推进流程切换到种土豆模式,还开始给自己立规矩、给自己做心理建设、把猪叫成深粉色像素点。这种落差本身就构成了传播点——它不像一份评测报告,倒像一段谁都能代入的游戏实况。

顺带一提,这段时间《我的世界》玩家群体里本来就在折腾各种AI玩法,包括在游戏里搭出一个能跑的语言模型,以及用模拟的果蝇神经系统去操控游戏角色。Astra这次的表现,算是又给这个方向添了一个挺有画面感的案例。

至于种土豆那几个小时到底算不算“摆烂”,Vals AI没有给出解释,Astra自己也没说。它只是把箱子那件事记了下来,然后继续种。