从平面标注到三维手势
AI助手正在从简单的文本界面走向多模态陪伴,Project Astra和Gemini 3.1 Flash Live已经能让用户实时讨论物理环境,通常用视觉边界框在摄像头画面里标出物体。这套方法在2D屏幕上很有效,但进入Android XR这类沉浸式平台后,问题变成了:怎么超越平面界面,做出真正具身、有空间感的对话。
Google XR的研究科学家Xun Qian和交互感知与图形负责人Ruofei Du在2026年8月25日介绍了AgentHands。这是一个由大语言模型驱动的XR原型,为对话智能体配上同步、富有表现力的手部手势,把抽象的口头指令变成直观的物理演示。
六维手势分类法
研究团队先在Google内部对XR和人机交互专家做了一轮形成性研究,搞清楚在3D环境里什么样的虚拟手才“可读”。他们把结论整理成一个多维分类法,定义智能体应该怎样用手在用户的物理空间里锚定对话。
这个分类法包含六个维度:手性、手势、空间性、时间动态、交互性和视觉效果。AgentHands的核心创新,是把大语言模型的高层推理映射成精确、实时的身体动作,让动作匹配智能体的“声音”和用户所处的XR环境。
用视线和场景重建注册物体
系统从一个轻量级物体注册模块开始。用户通过眼动注视和场景重建,可以快速“标记”物品,比如一盆兰花或一台笔记本电脑,生成带3D边界框的空间注册表,供智能体后续引用。
这套流程延续了团队此前在Human I/O和Sensible Agent上的研究。AgentHands进一步让AI智能体具备同步、富有表现力的手势,在用户执行物理任务时提供空间锚定的引导,弥合心理映射上的落差,提升参与感。
面向沉浸式平台的具身对话
人类交流时,手不只是指东西,还会描述形状、模仿动作、强调重点,而且都和语音同步。AgentHands利用扩展现实的空间理解能力,复现了这种自然协同。
该研究已发表在CHI 2026上。演示中,AgentHands让AI智能体在XR空间对话里做出同步手势,把关于周围环境的抽象说明转化为更自然、更有参与感的互动。
热门跟贴