打开网易新闻 查看精彩图片

信息来源:https://arxiv.org/abs/2610.02200

国庆假期里,一篇刚挂上预印本平台arXiv的论文,在人工智能圈掀起了不小的波澜。

美国麻省理工学院何恺明团队提出了一个名为VISTA的视觉框架,让通用多模态大模型在被称为AGI考卷的ARC-AGI-3上交出了满分答卷。

搭载Claude Opus 5.0时,VISTA通关全部25个公开游戏、183个关卡,拿下100分。换用GPT-5.6 Sol,成绩也达到98.27分。

更惊人的是效率:Claude总共只用了7542步,而首次上手的人类玩家合计用了17135步,AI少走了56%的路。

团队的核心判断出人意料,大模型的“脑子”其实早已够用,真正拖后腿的,是它的“眼睛”和“记性”。

一张数字表,困住了顶级大模型

打开网易新闻 查看精彩图片

ARC-AGI-3由Keras之父弗朗索瓦·肖莱参与创办的ARC奖基金会推出,今年3月正式亮相。

它由一系列交互式像素小游戏组成,开局不给说明、不讲规则,也不告诉玩家目标是什么。

玩家只能一步步试错,摸清每个物体的作用、世界运转的机制和获胜条件,再把经验带到下一关。

打开网易新闻 查看精彩图片

同一帧画面,左边是官方递给模型的数字表,右边是VISTA让它直接看的图

评分规则相当苛刻。AI不仅要通关,所用步数还要与首次游玩的人类相比,步数越多,得分越低,没通关的关卡直接记零分。

基金会发布时的测试显示,人类能解决全部游戏,而截至今年3月,前沿AI系统的得分还不到1%。

问题出在哪里?官方标准接口递给大模型的,往往是一张64×64的数字表格,画面上的小人、机关和路线,到了模型那里只剩4096个数字。

这就好比让人蒙上眼睛,听别人报坐标来玩《超级马里奥》。在这种“盲玩”模式下,官方基线中Claude Opus 5.0只得了约30分,GPT-5.6 Sol更是只有13分出头。

为了突破瓶颈,不少团队另辟蹊径,让模型把游戏规则写成可执行的程序,搭建一个“代码版世界模拟器”。

打开网易新闻 查看精彩图片

只把数字换成图片,GPT-5.6 Sol的分数涨了三倍多,能通关的游戏从1个变成9个

这类方法确实有效,但代价不小。以其中一个跳棋类游戏为例,某个程序化方案为它写下了约4000行Python代码。

摘掉眼罩,再递上一本相册

VISTA的思路简单得近乎朴素,核心只有三件事:让模型直接看画面,用自然语言思考,再配上一份不丢细节的视觉记忆。

在“看”这一步,模型收到的是一张512×512像素的游戏截图,还能随时放大局部区域查看细节。研究者甚至没有告诉它,这个世界本质上是一张64×64的网格。

打开网易新闻 查看精彩图片

VISTA的一个回合,模型看画面、想规则,需要时翻相册,最后才走一步

在“想”这一步,模型用自由的自然语言推理,自己决定思考什么、思考多久,并把对游戏的理解写进一份笔记。

同一个跳棋游戏,程序化方案要写几千行代码,VISTA的笔记只有一页纸。

最关键的是“记”。普通大模型的记忆藏在上下文缓存里,时间一长,早先的画面细节就会被压缩甚至丢失。

VISTA则把游戏返回的每一帧画面原样存档,模型可以像翻相册一样,随时调出任意一帧、任意区域,甚至读取精确的像素颜色。

打开网易新闻 查看精彩图片

点完橙块,模型先把前后4帧动画调出来逐帧比对,看懂了才接着走

团队把这种能力形容为一种“显式注意力机制”,看哪一帧、看哪一块,全由模型自己决定。

研究者还做了对照实验。无论把同一个游戏呈现为一维数字串、二维图像还是三维立体场景,VISTA都能摸清规则并通过第一关。

打开网易新闻 查看精彩图片

上下文从200K拉到780K、图片从8倍放到16倍,分数都不升反降

不过,纯数字表虽然也能玩,消耗的文本量却明显更多,在这个任务上,“看图”比“读数”更省力。

满分之后,还要冷静看

论文称,就团队所知,VISTA是首个不依赖程序合成、就在ARC-AGI-3上取得满分或接近满分的系统。

但满分并非独此一家。同期社区排行榜上,一些采用程序合成的方案同样拿到了100分,VISTA的突破在于路线更简洁,而非独占鳌头。

打开网易新闻 查看精彩图片

团队也坦承,所用模型发布时间晚于这批公开游戏,无法排除模型在训练中见过它们的可能。真正检验泛化能力的,是尚未公开的私有测试集。

同时,模型本身的能力是成功的关键,VISTA更像一把钥匙,把这些潜力释放了出来。

即便如此,这项研究依然传递出一个清晰信号:衡量AI的智能,有时要先确认它是否真的“看清了考题”。

对于正在押注智能体的科技公司而言,这也是一个提醒:与其不断堆砌复杂的外部系统,不如先想想模型缺的究竟是什么。

在团队看来,ARC-AGI-3只是试验场。既然VISTA能在三维场景中照样行动,它未来或许可以走进更复杂的游戏,乃至贴近真实物理世界的具身环境。