打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/d0dmowGeef3z3UO12BYMqg

打开网易新闻 查看精彩图片

01|视觉,为什么是一条闭环?

人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。

这套闭环有长期的心理学基础。经典著作《眼动与视觉》(1967)发现,同一幅画在不同问题下会引发截然不同的眼动轨迹:观看并非由图像单向决定,任务目标和中间假设会持续重定向注视。《视觉与视觉意识的感觉—运动理论》(2001)进一步把「看见」理解为掌握视觉输入如何随观察行为而变化;《自然行为中的眼动》(2005)则表明,人们在真实任务中会按需回看环境。《破解视觉知觉的「真正」谜题:作为外部记忆的世界》(1992)将这种策略概括为把外部世界当作可以反复查询的「外部记忆」,而不是把所有细节一次性存入大脑。

这种能力和真实应用息息相关。车间工作需要在一桌相似的零件中找到目标、检查差异;医生要在整张影像中逐区搜索并统计可疑病灶;旅行者要沿地图跨过一个个岔路,持续确认自己仍在正确路径上。每一次新发现都会改变下一次查看的区域,下一次观察又会反过来修正判断;只看懂大意远远不够。

打开网易新闻 查看精彩图片

基于以上动机,我们发布了 ActiveVision——一个专门测量这种「主动观察」能力的视觉推理基准。ActiveVision 包含 17 个任务和 3 类能力:

● 全局扫描(distributed scanning):在整张图里找全、数全

● 顺序追踪(sequential traversal):沿一条结构一步步走到底

● 属性迁移(visual attribute transfer):跨区域记住并比较细微视觉属性

ActiveVision 的三类任务也直接对应心理学中已知的基础视觉操作。《视觉数量辨别》(1949)和《为什么少量与大量目标的计数方式不同?》(1994)表明,少量目标可以被快速「瞬时计数」,数量增加后则需要逐项扫描;《曲线追踪:空间关系知觉的一种可能的基本操作》(1986)将沿轮廓追踪视为串行的注意过程;《视觉工作记忆对特征及其组合的容量》(1997)说明,跨区域比较受到视觉工作记忆容量限制,需要在目标与参照之间反复切换。《视觉程序》(1984)进一步指出,这类基础操作需要由注意力逐步执行。ActiveVision 将这些经典实验中的基础操作转化为可以直接测量模型的三类任务。

打开网易新闻 查看精彩图片

图 1|主动观察的真实应用与 ActiveVision 任务设计。

02|一道接近 9 倍的鸿沟

评测结果很明确:在没有使用外部工具的情况下,GPT-5.5 在所有模型中取得最高分 10.6%(9/85);而 3 位人类参与者的平均准确率为 96.1%(94.1%~97.6%)。两者之间存在接近 9 倍的差距。

即使是这个最高分模型,也在 17 个任务中的 11 个上拿到 0 分。

打开网易新闻 查看精彩图片

图 2|纯 CoT 模型与人类的准确率对比:最高分模型与人类仍相差近 9 倍。

提高推理强度也无法缩短差距。GPT-5.5 从不思考、直接回答,到使用最高推理强度,每题成本增长了超过两个数量级,其准确率仅从 2.4% 提升到 10.6%;Fable 5 在最高推理强度下的准确率只有 3.5%,反而在更低推理强度时达到 5.9%。

「还想得不够久」解释不了这些结果。更直接的迹象是,正确的视觉证据没有被稳定地带回推理过程。

从错误模式看,问题也很一致:全局扫描时漏数,顺序追踪时从起点直接猜终点,属性迁移时用语言先验替代真正的跨区域比较。模型能生成一段听起来合理的解释,却无法稳定完成「获取证据—保存中间状态—回到图像验证」的闭环。

模型看到了图,却未能持续观察其中的物体。

打开网易新闻 查看精彩图片

图 3|纯 CoT 模型的准确率与每题成本。

03|给它代码,能不能替它看?

那如果给模型代码、裁图、测量和其他视觉工具呢?

我们把同一套题交给 3 个工具型 Coding Agent 进行测试,得到的分数明显上升:Fable 5 + Claude Code 为 50.6%,GPT-5.5 + Codex 为 37.6%,Opus 4.8 + Claude Code 为 24.7%。不过,和人类的 96.1% 相比,仍有很大差距。

Agent 擅长把「看」改写成「算」:通过阈值分割、连通域、路径追踪等方法拆分题目,试图解决它们。不过,一旦真实纹理导致分割结果破碎,或追踪器在交叉处串线,Agent 往往无法察觉这些工具输出错误。

而且,这些提升并不均匀。3 个 Agent 在容易通过裁图、模板匹配或几何测量解决的属性迁移任务上达到了 43%~66%;到了必须准确穿过交叉点、持续跟踪方向和当前位置的顺序追踪任务,Codex 只做对 1/25,Opus 4.8 只做对 3/25,而 Fable 5 也只有 10/25。工具只有在「看」能被可靠地改写成一套计算时,才真正有效。

瓶颈没有消失,只是从「看图」转移到了「检查自己有没有看错」。

而且,使用 Agent 的代价不小:每题平均花费 12~15 分钟,API 等价成本达到 2.74~7.63 美元;人类平均约 34 秒,且不依赖任何工具即可完成。

工具会计算,但不会替你保持注视。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

图 4|工具型 Agent 成绩与典型失败案例。

04|怎样造出一场「看不完就答不对」的考试?

为了避免结论依赖几张手工挑选的「刁钻图」,ActiveVision 的每道题都先由确定性程序生成:位置、形状、曲线、拓扑和标准答案全部已知;再用 GPT-image-2 将其重绘成照片级场景,同时保持决定答案的结构不变。这样,每个任务都可以从新种子继续生成,答案精确、可复现,又不会让模型靠熟悉的卡通模板取巧。

例如,闭合区域可以变成航拍视角下的田野与河流,箭头链可以变成由脚印连接的彩色石块,曲线可以变成漂流木上的绳索。生成器负责把已知结构「翻译」成材质、光照和纹理;解题者却必须反过来从像素中恢复全局结构。

同时,为了避免模型看一次图就记住全部内容、不再看图,ActiveVision 中的所有元素均出现在连续采样的任意位置,形状逐题重新生成,路线沿随机曲线展开。模型无法依赖网格坐标、命名形状或固定路径,只能在推理过程中反复回到图像,逐步寻找、追踪并核验视觉证据,而不能只看一眼、压缩成摘要后直接作答。

ActiveVision 把重点放在感知能否持续参与推理;描述一张图只是起点。

  • 论文:https://arxiv.org/abs/2607.16165
  • AlphaXiv:https://www.alphaxiv.org/abs/2607.16165
  • 项目主页:https://activevision.dev
  • 数据集:https://huggingface.co/datasets/activevisionai/ActiveVision
  • 评测代码:https://github.com/saccharomycetes/ActiveVision

打开网易新闻 查看精彩图片

图 5|ActiveVision 数据生成流程:确定性程序、精确答案与真实照片重绘。

作者介绍

张家瑞是南加州大学计算机科学博士生,由 Willie Neiswanger 教授指导。本科毕业于清华大学,研究方向包括多模态感知与推理及 AI-for-Science。主页:https://saccharomycetes.github.io/

陶沐孜是南加州大学计算机科学博士生,师从马学喆教授。本科毕业于上海交通大学 ACM 班,研究方向包括多模态学习、理解与生成,关注多模态模型的细粒度视觉感知与生成能力。主页:https://muzi-tao.github.io/

王上上是南加州大学计算机科学博士生,由 Willie Neiswanger 教授指导。本科及硕士毕业于上海科技大学。研究兴趣包括大语言模型推理、后训练、强化学习以及 AI-for-Science。主页:https://shangshang-wang.github.io/