打开网易新闻 查看精彩图片

南洋理工大学S-Lab联合Ropedia提出S-Agent,把空间理解从一次性回答改写为一条可执行的行动链:VLM 负责读懂问题、规划下一步,DA3 等专用模型负责深度、位姿和 3D 对齐,空间专家再把几何输出转化为可用证据。论文结果显示,S-Agent 在 zero-shot 设置下取得 MMSI-Bench 46.4%、ViewSpatial-Bench 60.0% 的成绩;通过 S-300K 轨迹蒸馏,8B 模型进一步在 MMSI / ViewSpatial 上达到 41.6 / 46.8。

打开网易新闻 查看精彩图片

  • 论文标题:S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
  • 项目页:https://ropedia.github.io/S-Agent
  • 论文:https://arxiv.org/abs/2606.20515
  • 演示视频:https://youtu.be/f89D0ZCJWKo

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/3P_oyOJwRMkq_RaXbl7bUA

“站在耳机旁,背对入口门,相机在你的哪个方向?”

开场视频给出的,是一个典型的动态空间推理问题。对人类来说,它像一次短暂的心理旋转;对视觉语言模型来说,它要求模型同时完成实体定位、跨帧对齐、三维理解和自我中心坐标转换。模型拿到的不是一张线索完整的全景图,而是一段视频中抽取的 64 帧:耳机、入口门和相机分散在不同观察里,“左、右、前、后” 还必须以人的站位与朝向重新定义。

图 1 展开了这条行动链。S-Agent 没有直接猜答案,而是先定位三个实体,再把离散的 2D 线索提升到共享 3D 场景,随后以耳机为原点、以 “背对入口门” 为朝向建立自我中心坐标系,最终判断相机位于右后方,提交 D(back-right)。整条轨迹包含 3 轮规划与 6 次工具调用,每一步行动本身就是推理的一部分。

这段不到一分钟的演示,浓缩了 S-Agent 的核心主张:空间智能不应只是 “看完视频后给出一个答案”,而应进入 Agent 式行动循环 —— 持续追问 “下一步该看哪里、测什么、验证什么”,并把每一次行动得到的证据累积成可追踪的世界状态。

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/3P_oyOJwRMkq_RaXbl7bUA

图 1|案例视频中的完整行动链:定位实体、3D 对齐、建立自我中心坐标系,再解析相机象限。

空间智能迈入 Agent 时代:

让 VLM 理解任务,让专用模型处理几何

S-Agent 的切入点并不是否定 VLM,而是重新安排 VLM 在空间系统中的位置。VLM 的长处是理解:它能读懂问题意图,识别场景中的实体和关系,并把自然语言指令转化为可执行的判断目标。但在真实三维空间里,仅有语义理解还不够。深度估计、相机位姿、三维对齐、物体尺度与朝向,本质上更接近几何感知与空间计算,往往不是通用 VLM 最擅长的部分。

因此,S-Agent 的最初想法是:不要让 VLM 在一个模型里硬扛所有事情。对于 “图中有什么、问题在问什么、下一步该验证什么”,VLM 很强;但对于 “这个点到底有多远、相机如何运动、两个视角如何对齐”,DA3 等专用深度 / 三维模型通常更可靠。空间智能的关键,不是让 VLM 变成万能几何模型,而是让它学会把合适的问题交给合适的工具。

在这个基础上,S-Agent 把空间推理重新表述为时空证据累积(spatio-temporal evidence accumulation):VLM 不必一次性在参数内部完成识别、几何恢复、坐标变换和关系判断,而是作为 Agent 围绕当前问题发起一连串行动,调用 2D 感知、3D 几何和空间专家模型逐步补齐证据,并把已经获得的场景状态保留下来。

从回答器到行动规划器:

框架图里的三层分工

图 2 对应的是 S-Agent 的系统结构。VLM 在这里不再是被动回答器,而是语义规划器:每一步,它都会查看问题、原始观察、当前场景记忆和此前行动历史,再决定下一步需要哪类证据、应该调用哪个工具,以及现有证据是否已经足够。

工具体系按空间理解的层次被组织为三层。Level 1 负责 2D 视觉证据获取,包括从长视频或多视图输入中挑选关键帧、定位问题涉及的实体,以及借助开放词汇检测补齐遗漏目标;Level 2 把这些局部线索提升到三维空间,通过度量深度、相机位姿和鸟瞰图/新视角,把分散观察对齐到共享坐标系;Level 3 再由计数、测量、相对位置、视觉朝向和物体视角等空间专家,把密集且可能带噪声的几何输出转化为规划器可以直接使用的高层空间事实。

这种分工的关键,不只是 “给 VLM 加几个工具”。S-Agent 把语义决策、几何证据与状态维护拆成彼此可协作的行动模块:模型负责提出下一步行动,工具负责返回可验证的证据,记忆负责让证据在后续行动中继续生效。

论文中的消融实验也说明,进入 Agent 时代并不等于把所有 3D 输出原样塞给模型。原始深度、相机位姿和点云往往包含密集数值与噪声,规划器未必能直接读懂;真正拉开差距的是 Level 3 空间专家把这些几何输出过滤成任务相关的测量、相对位置和方向判断,再由双记忆把它们接入后续行动。也就是说,S-Agent 的关键不是 “工具更多”,而是 “每一步行动都能产生可用证据”。

打开网易新闻 查看精彩图片

图 2|S-Agent 框架示意:语义规划器、三层空间工具与双记忆协同工作。

结果:zero-shot 领先,

蒸馏后 8B 模型继续逼近前沿模型

论文首先验证了 training-free 的使用方式:无需对底座模型进行空间微调,只要把 S-Agent 的行动规划、空间工具与记忆机制接入现有 VLM,就能在多视图和视频空间推理任务上获得明显提升。论文表 1 展示了 MMSI-Bench 的 zero-shot 结果,S-Agent 在平均分上达到 46.4%,高于 Gemini 3 Pro 的 45.2% 和 GPT-5.4 的 41.9%。

打开网易新闻 查看精彩图片

论文表 1|MMSI-Bench zero-shot 结果表,截图自论文正文。

更重要的是,提升并不只体现在平均分上。相较所用 InternVL3.5-8B 底座,S-Agent 在 MMSI-Bench 上提升 17.4 个百分点,其中相机运动子任务提升 31.1 个百分点。在 ViewSpatial-Bench 上,S-Agent 达到 60.0%,人物视角相对方向(P-RD)得分为 81.1%;在 ReVSI 上,其平均成绩为 58.8%。

图 3 进一步把 zero-shot 和 SFT 两条结果线并排呈现。更值得关注的是蒸馏后的 S-Agent-8B:研究团队用约 29.2 万条 S-Agent 轨迹对 Qwen3-VL-8B 进行监督微调,模型在 MMSI-Bench 上从 31.1% 提升到 41.6%,在 ViewSpatial-Bench 上从 42.2% 提升到 46.8%。对照 GPT-5.4 的 41.9% 和 45.6%,这个 8B 模型在前一项几乎持平,在后一项高出 1.2 个百分点。

论文表 4 则给出蒸馏结果的完整对照:S-Agent-8B 同时超过 Qwen3-VL-8B-Instruct 和使用同一 8B planner 的 training-free S-Agent。这说明,紧凑模型未必需要把全部空间知识 “压进参数”;当它学会何时行动、如何解释工具结果,以及怎样跨步骤整合证据时,系统级能力可以显著超越底座模型本身。

打开网易新闻 查看精彩图片

图 3|论文项目视频中的性能对比页。S-Agent 在 zero-shot 与 SFT 设置下均获得显著提升。

打开网易新闻 查看精彩图片

论文表 4|S-Agent-8B 在 MMSI、ViewSpatial 与 ReVSI 上的蒸馏结果,截图自论文正文。

S-300K:把强 Agent 的行动过程,

变成小模型的课程

性能提升背后,是 S-300K 这套行动数据。S-Agent 不只是一个推理框架,也是一台行动轨迹数据生成器。研究团队使用强模型驱动的 S-Agent 生成空间推理轨迹,过滤掉执行失败或答案不正确的样本,并将有效过程整理为 S-300K。最终用于监督微调的样本约为 29.2 万条。

与只提供 “问题 — 答案” 的传统指令数据不同,S-300K 把监督信号拆成多种粒度:完整轨迹教模型如何从问题走到结论;轮次级样本教模型在当前上下文中选择下一步动作;专家/工具级样本则专门训练某一类工具的调用与结果解释。

这相当于把强 Agent 的行动方法拆成一套可学习的课程。学生模型学习的不只是最终标签,还包括如何发现证据缺口、如何修正失败的定位,以及何时停止继续调用工具。图 4 展示的多类案例也说明,距离、计数、路线、尺寸和方向判断都可以被组织成可追踪的行动过程;对空间智能而言,行动过程由此成为比单一答案更重要的训练资产。

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/3P_oyOJwRMkq_RaXbl7bUA

图 4|项目展示的多类真实推理案例,覆盖距离、计数、路线、尺寸与方向等任务。

从 “更大的模型” 转向 “更会行动的系统”

把这些素材串起来看,S-Agent 展示的是一条不同于单纯扩展参数规模的路线:让通用 VLM 专注于行动规划,把几何恢复交给专用工具,把跨帧一致性交给记忆,再用可检查的推理轨迹把能力蒸馏回更小的模型。

这套思路可以自然延伸到机器人导航与操作、AR/VR 空间助手、长视频问答、自动驾驶场景理解等任务。它们共同需要的,不只是看见物体,而是主动选择下一步观察、测量和验证,并持续维护物体在三维世界中的位置、朝向与变化。

从这个角度看,S-Agent 把空间智能的评价重点从 “模型有多大” 推向 “系统是否会行动”:能否判断证据缺口、调用可靠工具、沉淀场景状态,并把成功的行动链反哺给更小模型。

S-Agent 给出的方向已经相当明确:当一次猜测被改写为可追踪、可复用、可蒸馏的行动链,视觉模型就从 “看懂一帧” 走向 “理解一个空间”;空间智能也由此从静态问答迈入可执行、可积累、可迁移的 Agent 时代。