该论文的第一作者和通讯作者均来自北京大学王选计算机研究所,共同第一作者为博士生雷廷和实习生刘佳林,通讯作者为博士生导师刘洋。团队近年来在 TPAMI、IJCV、CVPR、ICML 等顶会上有多项代表性成果发表,多次荣获国内外多模态理解与生成竞赛冠军,和国内外知名高校、科研机构广泛开展合作。
本文主要介绍来自该团队的最新论文 Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild。
该工作聚焦于开放世界中的人 — 物交互检测任务,提出了无需 HOI 专项训练的 AgentHOI 框架,将检测过程拆解为 “交互语义推理 — 人物与物体定位” 两个环节,并设计上下文感知多轮推理和多维度交互定位机制,使模型在无需 HOI 标注数据和参数更新的情况下,也能发现细粒度交互并准确定位相关实例,为开放词汇、低标注成本的人 — 物交互理解提供了新的研究思路。
目前该工作已被 ECCV 2026 正式接收,相关代码与模型已全部开源。
- 论文标题:Towards Bridging the Gap between Large-Scale Pretraining and Efficient Finetuning for Humanoid Control
- 作者:雷廷、刘佳林、徐铸、彭宇新、刘洋
- 机构:北京大学王选计算机研究所
- 项目主页:https://ltttpku.github.io/AgentHOI-Page
- 论文链接:https://arxiv.org/abs/2607.13881
- 代码地址:https://github.com/oceanflowlab/AgentHOI
传统 HOI 检测,为什么一到真实世界就容易失灵?
这里的 HOI,指 Human-Object Interaction,也就是人与物体交互检测。它要求模型输出类似 “人 - 骑 - 自行车”、“人 - 拿 - 杯子” 这样的结构化三元组,并同时框出对应的人和物体,这项能力是场景理解的重要基础,可用于机器人感知、智能驾驶、视频分析等任务。
如图 1 所示,现有 HOI 检测器大多采用监督学习范式:先规定动作与物体的类别词表,再用带有人框、物体框和交互标签的数据训练分类器。这种方法在封闭测试集里效果不错,却有两个天然短板。
一是标注成本高。复杂图像中可能同时出现多个人、多个物体和多种动作,穷举并标注所有交互十分费时。
二是泛化受限。现实中的动作组合、物体外观和图像风格几乎无法提前列完;一旦测试画面偏离训练分布,模型就容易 “见过词,却没见过这种组合”。
图 1 和现有方法的框架对比
近年的开放词汇 HOI 方法开始借助 CLIP 或多模态大模型,但很多方案仍把它们当作特征提取器、语义对齐器或提示词生成器,最后依然要训练任务专用分类器。
AgentHOI 则把问题重新拆解:HOI 检测不一定非要是一个固定词表上的分类任务,也可以是 “开放语义推理 + 精确空间定位” 的协作过程。
一个模型负责想,一个模型负责找
AgentHOI 的基础版本(AgentHOI-Base)由两个现成的视觉基础模块组成。
第一步,多模态大模型查看整张图像,根据场景推理可能存在的 “动作 - 物体” 组合。例如,它可以先判断画面中有人 “滑滑板”。
第二步,视觉定位模型接收相应的文字描述,分别找出执行动作的人和被交互的物体,输出两者的边界框。
论文实验采用 GPT-4o 承担多模态理解与推理,GroundingDINO 承担空间定位。整个流程不需要在 HOI 数据上重新训练,也没有引入 HOI 专项可学习参数。
不过,直接把两个基础模型串起来还不够。如图 2 所示,研究团队发现,复杂场景里主要有两类问题:
图 2 (a):上下文感知多轮推理提升交互识别准确率;(b):多维度交互定位提升复杂场景下的实体定位准确
其一,多模态大模型容易只说出最显眼的动作。如果一个人同时踩着滑板滑行、背着背包,首次回答可能只识别出前一种交互,遗漏 “背着背包” 这一关系。论文统计显示,相比只有一个 HOI 的图像,多 HOI 场景中的交互召回率会下降 14.92%。
其二,定位提示太笼统时,模型容易找错人或物。比如两个人同时骑摩托车,只输入 “一个正在骑摩托车的人”,定位模型很难知道具体指哪一个。
为此,如图 3 所示,完整版 AgentHOI 加入了两套关键机制:
图 3 (a):AgentHOI-Base 方法概览;(b):AgentHOI 完整的方法概览
上下文感知多轮推理(Context-aware Multi-round Reasoning,CMR)
如图所示,AgentHOI 并非通过一次提问直接生成全部交互,而是将识别过程拆分为三个相互衔接的推理阶段,利用前一轮结果持续补充和细化 HOI 预测。
第一轮是初始 HOI 识别。多模态大模型首先观察整幅图像,识别画面中较为显著的人 — 物交互。例如,模型可以发现左侧的人正在拿着一个瓶子。
第二轮是 HOI 再挖掘。系统将首轮结果作为上下文,进一步提示模型检查尚未识别的交互。在已有结果的帮助下,模型会把注意力转向其他人物和物体,例如继续发现右侧的女性拿着苹果,从而减少复杂场景中的交互遗漏。
第三轮是动作重分配。针对已经识别的人 — 物组合,系统结合该物体可能对应的动作类别,引导模型重新检查二者之间的关系。例如,对于人与瓶子的交互,除 “拿着” 之外,还可能同时存在 “握住” 等更细粒度的动作。经过这一轮复核,模型能够为同一组人物和物体补充更加完整的交互标签。
三个阶段分别负责发现主要交互、补充遗漏交互和细化动作类别,使模型在多人、多物体场景中获得更完整的 HOI 识别结果。
多维度交互定位(Multifaceted Interaction Localization,MIL)
获得交互类别后,AgentHOI 还需要在图像中准确定位每条交互对应的人和物体。基础方法通常将 HOI 三元组转换为简单描述,例如 “一个拿着瓶子的人”。但在多人、多物体同时出现的场景中,这类描述难以区分外观和动作相近的实例,容易导致定位错误。
为此,AgentHOI 设计了多维度交互定位机制。它利用多模态大模型为每个交互实例分别生成人物描述和物体描述,并在提示词中融入三类信息:
- 语义信息:人物正在执行什么动作,以及与哪个物体发生交互;
- 空间信息:人物或物体位于画面中的大致位置;
- 外观信息:人物的服装、帽子以及物体的颜色、标签等可区分特征。
以图中的人物 — 瓶子交互为例,人物描述可由简单的 “拿着瓶子的人” 扩展为 “画面左侧穿黑色上衣、戴帽子、正在拿着或握住瓶子的人”;物体描述则可写为 “被人拿着或握住的、带红色标签的瓶子”。随后,视觉定位模型分别根据两条描述寻找对应的人和物体,并输出各自的边界框。
通过这种面向具体实例的消歧描述,MIL 能够综合利用动作、位置和外观信息,降低相似人物或物体之间的混淆,使识别出的 HOI 语义与图像中的具体实例准确对应。
开放世界交互检测性能分析
研究团队首先在 HICO-DET 上评估 AgentHOI。该测试集包含 9658 张图像、600 类 HOI 组合,涉及 118 种动作和 80 类物体。
如表 1 所示,在零样本评测中,AgentHOI 在未见动词(UV)和稀有优先未见组合(RF-UC)设置上分别取得 29.85 和 38.64 mAP,为论文表格中对比方法的最佳结果。
为了模拟真实世界中的分布变化,团队还对测试图像进行了风格迁移和画质退化,后者包括模糊、噪声与压缩等情况。在这些变化下,依赖源数据分布训练的监督方法普遍出现明显性能下降;AgentHOI 在 UV、UO 和 RF-UC 等多项设置上保持领先,显示出较强的跨风格和抗退化能力。
表 1 HICO-DET 数据集零样本设定下的定量实验结果
如表 2 所示,在默认 HOI 检测设置下,AgentHOI 整体达到 29.61 mAP,高于 OpenCat 的 25.82、Weakly-HOI 的 25.70 和 Align-Former 的 20.85。更明显的差距出现在 Rare 类别:AgentHOI 得到 40.33 mAP,而对比的弱监督方法中最高为 24.52。
这背后的原因是,弱监督方法即便减少了边界框标注,仍需从有限的任务数据中学习交互模式;当某些类别样本很少时,视觉规律难以学稳。AgentHOI 则直接调用基础模型在大规模预训练中获得的视觉 - 语言知识,再通过多轮推理发现长尾动作,因此不必依赖某一类交互在 HOI 训练集里出现多少次。
表 2 HICO-DET 数据集默认设定下的定量实验结果
如表 3 所示,在词表规模更大、类别更丰富的 SWIG-HOI 数据集上,AgentHOI 无需针对新数据集重新训练,整体取得 13.00 mAP,未见类别取得 11.61 mAP。后者超过全监督 CMD-SE 的 10.70 mAP,并接近 SGC-Net 的 12.46 mAP。
表 3 SWIG-HOI 数据集的定量实验结果
更值得关注的是,AgentHOI 不仅能识别数据集 “规定好的答案”,还能发现标注之外的真实交互。面对大规模 HOI 数据集中常见的漏标问题,它可通过多轮推理和上下文理解,补充识别 “遛狗” 等细微或重叠动作;即使不使用特定数据集预设的物体与动作词表,也能理解开放场景中的任意交互。例如,面对一张 “骑马” 图片,除了数据集标注的 “ride horse”,AgentHOI 还能进一步识别 “straddle”“hold” 和 “swing lasso” 等动作。这意味着,AgentHOI 正在推动 HOI 检测从 “在固定选项中做选择”,迈向开放、灵活的场景理解。
图 4 HICO-DET 数据集上的定性结果
总结与展望
AgentHOI 将 HOI 检测拆分为开放语义推理和空间定位两个环节,通过多模态大模型与视觉定位模型协作,在不使用 HOI 专项训练数据和不更新模型参数的情况下完成交互识别与定位。实验结果表明,这一框架在零样本、长尾类别和分布偏移等设置中具有一定的适应能力。
目前,该方法仍受到推理成本、基础模型能力和生成结果稳定性等因素的限制。未来可以进一步研究更轻量的推理流程、更可靠的交互验证机制,以及面向视频和动态场景的时序建模方法,在保留开放词汇能力的同时提高效率与稳定性。
热门跟贴