把一张《我的世界》开局截图发给顶级多模态大模型,它们能准确说出“黄昏、有怪物,面临威胁”。但美团 LongCat 团队发现,一旦把这些模型丢进实时变化、需要持续探索的开放世界,情况完全不同。
为此,团队构建了 MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地检验多模态大模型在长程规划和隐藏前置条件任务中的真实能力。
一个能直接跑的评测基准
MineExplorer 包含 813 个人工验证的高质量实例,覆盖从 1-hop 到 4-hop 的任务难度,并配套规则化的里程碑自动评测框架。团队还开源了多智能体数据合成流程的完整代码,以及一个基于 Minecraft 的沙盒环境,既能当考场,也能当练兵场。
不是看图问答,而是持续交互
MineExplorer 不要求模型看一张截图做选择题。每个任务实例运行 1800 个环境步,每步执行 0.1 秒,对应一段 3 分钟的连续交互视频。模型每做一个动作,世界状态就更新一次,它必须根据最新画面不断调整策略。
更关键的设计在于“隐藏前置条件”。任务按跳数分级,简单任务是目标明确的单跳任务;困难任务由 2—4 跳组成,最终目标虽然给出,但要完成它,必须先推理并完成若干没有在指令里说明的前置子任务。
测的是通用探索,不是背游戏攻略
MineExplorer 主动剥离游戏专有知识。对每一个原子任务,团队用 LLM 裁判判断其主要依赖通用世界常识,还是 Minecraft 专有机制,并过滤掉后者。换句话说,它测的不是“AI 会不会玩 Minecraft”,而是“AI 能不能在一个动态物理世界里自主探索”。
多智能体协作造题
构建高质量长程任务基准本身就有难度。MineExplorer 采用多智能体协作流程,五个专业 Agent 在一个群聊里协作,由一个 orchestrator 控制发言顺序。流程分初始化和辩论两个阶段,先生成初稿,再由专家和验证器找出问题并修订。
人工评估结果显示,多智能体流程把有效率拉高约 30 个百分点,质量分提升约 0.5 分,在最难的 4-hop 任务上优势尤其明显。最终保留了 813 个通过人工验证的高质量复合任务实例。
14 项细粒度能力覆盖
MineExplorer 借鉴 ReAct 范式,把开放世界探索拆解成三大能力维度,共 14 项细粒度能力:
- 感知:空间、时序、实体、状态、资源。
- 推理:常识、因果、关系。
- 行动:移动、跳跃、采集、放置、合成、攻击。
最终基准在三大维度上都有充足覆盖,其中空间感知、移动、采集等基础能力出现频率最高,常识推理、因果推理也占了相当比例。
18 款模型集体“考砸”
MineExplorer 给出了 18 个顶级模型的真实分数,横跨 Claude、GPT、Gemini 等八大家族。表现最好的 Claude-Opus-4.6,整体任务成功率也只有 41 分。
从 1 跳任务到 4 跳任务,Claude-Opus-4.6 的表现从 77 分一路下滑到 12 分。每增加一层隐藏的前置依赖,模型就掉一个台阶。
会看,但不会想
几乎所有被测模型都呈现同一个规律:感知分数大于行动分数,行动分数大于推理分数。以 Claude-Opus-4.6 为例,整体感知分 61.91,推理分 54.71。瓶颈不在于看不见,而在于看懂了却无法串联成有效策略。
团队对 Claude-Opus-4.6 的失败案例做了归因分析,导航失败是最大的错误来源,占比近 60%。
更多步数、更多记忆都不是解药
消融实验显示,模型失败并非因为资源不足。能解的任务,模型在早期就解出来了;解不了的,给到 1800 步上限照样解不了。增加历史画面帧数到一定程度后,性能反而会下降,因为过期的观察会干扰对当前局面的判断。
核心结论是:瓶颈不在资源,而在模型没法把已有的信息和当前世界状态对齐。
从看见世界到探索世界的鸿沟
MineExplorer 揭示了一个被乐观情绪掩盖的能力断层:当前的多模态大模型已经具备不错的感知力,但严重缺乏在动态世界中持续行动的探索力。
这对正在快速升温的具身智能赛道有几个直接启示:感知层基本就绪,规划层是瓶颈;行业需要更接近真实复杂度的评测标准;MineExplorer 交付的不是一套静态题库,而是评测、造题、训练共用的同一套基础设施。
热门跟贴