从平面标注到立体手势,XR里的AI对话缺了什么

AI助手正在从文本框里跳出来,变成能看、能听、能跟着你走的多模态伙伴。Project Astra和Gemini 3.1 Flash Live已经能让用户对着摄像头讨论眼前的物体,办法是在画面里套上方框标注。这套逻辑在手机屏幕上很顺,但一进入Android XR这类沉浸式平台,问题就来了:平面UI之外,AI该怎么真正“站”在用户身边,用身体和空间对话?

打开网易新闻 查看精彩图片

Google XR团队的研究科学家Xun Qian和交互感知与图形负责人Ruofei Du在2026年8月25日发布了一项原型,名叫AgentHands。它要解决的正是这个缺口——让对话智能体在XR空间里,不仅说话,还能用手势同步表达。

打开网易新闻 查看精彩图片

手不只是用来指的

人在面对面交流时,手的作用远不止“指向某个东西”。手会描摹形状、模仿动作、在关键处加重语气,而且这些手势和语音是同步发生的。AgentHands想把这套自然协同搬进三维世界。它利用扩展现实的空间理解能力,让AI代理在给出语音指令的同时,做出与之匹配的手部动作,把抽象的口头说明变成直观的物理演示。

这项研究发表在CHI 2026上,是团队此前Human I/O和Sensible Agent研究的延续。按照作者的说法,AgentHands进一步给AI代理装上了富有表现力、与语音同步的手势,目标是让围绕物理环境的对话更自然,也更容易让人投入。

六个维度定义一只“看得懂”的虚拟手

要让虚拟手在三维环境里“看得懂”,团队先做了一件事:找Google内部的XR和人机交互专家做形成性研究,弄清楚什么样的虚拟手才具备可读性。他们把结论整理成一个多维分类体系,用来规定代理在用户物理空间里该怎样用手势来锚定对话。

这个分类体系包含六个维度:

  • 用手偏好(Handedness)
  • 手势(Gesture)
  • 空间性(Spatiality)
  • 时间动态(Temporal Dynamics)
  • 交互性(Interactivity)
  • 视觉效果(Visual Effects)

从眼睛注视到物体注册,系统怎么工作

AgentHands的核心创新,是把大语言模型的高层推理映射成精确、实时的身体动作,让动作既匹配代理的“声音”,也匹配用户所处的XR环境。系统的工作流程从轻量级物体注册模块开始。

打开网易新闻 查看精彩图片

用户可以通过眼动注视和场景重建,快速“标记”物品——比如一盆兰花或一台笔记本电脑。系统会为这些物品建立带三维边界框的空间注册表,供代理后续引用。这样一来,AI在对话中就能明确指向用户空间里的具体对象,而不是凭空比划。

把语言推理变成同步手势

注册完成后,AgentHands会把大语言模型生成的内容拆解为可执行的手势序列。手势不是随机播放,而是和语音节奏、语义重点绑定在一起。比如代理在解释“把这个部件顺时针转一下”时,手可以同步做出旋转的示意动作,同时指向对应的部件位置。

这种设计瞄准的是一个具体痛点:在XR环境里,用户听到语音指令后,往往还要在脑子里把“说的是哪个东西”“该怎么动”翻译一遍。AgentHands试图用同步手势把这个“心理映射”的负担降下来,让用户少想一步,直接跟着做。

面向物理任务的沉浸式引导

按照论文描述,AgentHands的目标场景是物理任务中的空间引导。用户戴着XR设备,面对真实环境里的物体,AI代理一边说话一边用手势给出位置、方向和操作方式的提示。相比传统的语音加屏幕标注,这种方式的优势在于手势本身就是三维的,可以直接落在用户视野里的真实物体旁边。

团队强调,这个原型目前仍是研究阶段,重点在于验证手势与语音同步能否提升用户在物理任务中的参与度和理解效率。至于后续是否会进入产品化,原文没有给出进一步说明。