一个多模态模型在决策基准里拿了第一,靠的不是答题,是打马里奥。
ModelScope 发布视觉多模态大模型 JEV-27B-VL,在独立决策基准 Decision Index Vision 中以 77.8% 的准确率位列 20 款参评模型第一。这个基准包含 13,695 个样本,考的不是看图说话,是决策。
它到底在测什么
Decision Index Vision 的评测对象是模型的决策能力。JEV-27B-VL 在这项评测中不仅准确率登顶,置信度校准的表现也被单独提及——模型输出判断时,对自己有多确定,这件事同样被纳入考量。
换句话说,评测关心的不只是选对,还有模型知不知道自己可能选错。
马里奥演示:从看图到动手
发布方用一段马里奥游戏的实时演示来展示能力。模型需要在短延迟内解析游戏画面,并输出操作的概率分布——不是给一个动作,是给一组动作各自的可能性。
这构成了实时连续决策:画面在变,模型要持续给出下一步的概率判断,而不是回答一道静态题目。置信度校准在这里同样起作用,模型对每个动作的把握程度被一并输出。
演示验证的是目标导向的连续决策特性,而非单帧图像理解。
从静态问答到交互式 Agent
这一转变被概括为:多模态模型正从传统的“静态看图问答”向真正的“交互式智能体(Agent)”演进。
静态问答的输入是一张图、一个问题,输出是一段文字,任务到此结束。交互式 Agent 的输入是持续变化的画面流,输出是动作,任务在时间轴上延续,每一步都影响下一步。
两者的差别不在模型规模,在任务形态。
潜在落点
这类能力被指向两个方向:GUI 自动化与具身智能。前者需要模型看懂屏幕、决定点哪里;后者需要模型看懂环境、决定怎么动。共同点是都要在动态场景里连续做决策,而不是一次性给出答案。
20 款模型参评,13,695 个样本,77.8% 排第一。数字本身不惊人,惊人的是评测的题目类型变了——从“这张图里有什么”变成了“下一步该做什么”。
热门跟贴