首页
学习
活动
专区
圈层
工具
发布

AgentHands:为XR智能体对话生成交互式手势,实现空间化引导

随着AI助手从简单的文本界面进化为多模态伴侣,我们正在见证一种转变——AI向更主动、更情境感知的辅助方向迈进。Project Astra和Gemini 3.1 Flash Live等近期创新已经允许用户实时讨论周围的物理环境,通常借助视觉边界框叠加来识别摄像头画面中的物体。虽然这些叠加层在2D屏幕上效果显著,但向Android XR等沉浸式平台的过渡带来了独特挑战:如何突破平面UI的限制,打造真正具身化、具有空间感知能力的对话?

为弥合这一差距,谷歌研究团队推出了AgentHands——这项研究原型已在CHI 2026发表,它将协同语音手势的能力带入三维世界。在人类交流中,手势不仅仅是指点,还能描述形状、模拟动作、强调重点,并与语音同步配合。AgentHands通过利用扩展现实(XR)的空间理解能力,复现了这种自然协同效应。作为Human I/O和Sensible Agent等前期研究的延伸,AgentHands进一步为AI智能体配备了富有表现力、与语音同步的手势,将抽象的口头指令转化为直观的物理演示,让关于周围环境的对话变得更加自然生动。

为奠定设计基础,研究团队在谷歌内部面向XR和人机交互(HCI)专家开展了一项形成性研究,以确定是什么让虚拟手势在三维环境中"清晰可读"。研究团队将这些洞见提炼为一套多维度分类体系,定义了智能体应如何运用手势将对话锚定于用户的物理空间中。该分类体系涵盖六个维度:惯用手、手势类型、空间性、时间动态、交互性和视觉效果。

AgentHands的核心创新在于其将大语言模型的高层推理映射为精确、实时物理动作的能力,这些动作能够与智能体的"语音"及用户的XR环境完美匹配。系统工作流程如下:

首先是轻量级对象注册模块。借助眼动追踪和场景重建,用户可以快速"标记"物品——例如兰花或笔记本电脑——从而创建一个包含三维边界框的空间注册表,供智能体随时引用。

在手势库方面,系统构建了涵盖三类语义的手势行为库:指示性手势(用于参照定位)、图示性手势(用于描绘动作或形态)以及表达性手势(用于传递社交线索和情感)。

当用户提出问题时,后端大语言模型生成的回应中内嵌了GestureEvent指令。每个事件关联特定触发词,并依照分类维度编码手势行为的基本参数。

XR头显上的本地解析器协调文本转语音(TTS)播放与动画引擎的运作。通过利用词级时间戳,智能体的手势能够与语音完美同步,提供清晰、富有表现力的空间参照。

通过整合上述模块,AgentHands在语言意图与物理动作之间建立了无缝桥梁,将标准大语言模型输出转化为丰富的多模态表达——智能体生成的回应通过语音和空间精准的动作共同呈现,使复杂的操作指引得以在用户实际所处的环境中原位演示。

在具体应用场景中,AgentHands展现出多样化的实用价值:

互动教学:在兰花养护场景中,智能体不只是说"检查根部",而是将双手移至植株底部,勾勒出气生根的轮廓,同时讲解其功能。

技术操作指引:在3D打印机操作场景中,智能体能够演示旋转并按下旋钮、选择文件所需的确切手势序列,让复杂的物理界面操作步骤变得直观易懂。

生活陪伴:智能体还可作为健康生活教练,与用户的实际行为产生互动。例如,当用户面临不健康的选择时,智能体会做出"警示"手势并配合视觉效果进行提醒。

为评估手势的实际效果,研究团队开展了一项被试内实验(N=12),将AgentHands与纯语音基线系统进行对比。两种条件使用相同的实验脚本口头内容,唯一变量是是否启用具身手势及其同步动作。参与者完成了两项兼顾日常护理与技术操作的流程性任务。

实验结果证实,XR与协同语音手势的结合对于空间锚定交互极为有效。研究团队从多项关键通信效能指标对数据进行分析,结果显示AgentHands在位置感知、动作理解和警示可察觉性等方面均显著优于基线系统。

AgentHands代表着迈向未来AI系统的重要一步——这类系统不仅能分析我们的世界,更能在其中动态运作。通过将协同语音手势与XR的空间能力结合,将对话锚定于物理动作,该系统有望降低复杂任务的认知负荷,让空间计算更易获取、更以人为中心。

随着Android XR生态系统的持续演进,研究团队正在探索让手势更加个性化的方式,包括适配用户的惯用手或学习其特定的空间习惯,以实现更加无缝的人机协作。

本研究由刘子艺(Ziyi Liu)在谷歌担任学生研究员期间主导完成,是多个团队联合协作的成果。团队对David Li、周仲义(Zhongyi Zhou)和David Kim的关键贡献,以及Adarsh Kowdle、Guru Somadder和Shahram Izadi在战略指导和审阅方面的支持表示诚挚感谢。

Q&A

Q1:AgentHands是什么技术?它解决了什么问题?

A:AgentHands是谷歌研究团队开发的一款XR研究原型,已在CHI 2026发表。它将大语言模型的推理能力与同步手势动画结合,赋予AI智能体在扩展现实环境中做出与语音同步的手势。它解决的核心问题是:在3D沉浸式场景中,纯语音指令缺乏空间定位,用户难以理解"在哪里""做什么",AgentHands通过具身手势将抽象指令转化为直观的物理演示。

Q2:AgentHands的手势是怎么生成的?

A:系统分三步生成手势。首先,用户通过眼动追踪"标记"周围物体,建立3D空间注册表。然后,当用户提问时,后端大语言模型在生成回答的同时嵌入GestureEvent指令,指定手势类型和触发词。最后,XR头显上的本地解析器根据词级时间戳,让智能体的手势与语音实时同步播放,实现语音与动作的精准配合。

Q3:AgentHands的用户实验结果怎么样?

A:研究团队进行了12人参与的被试内对比实验,将AgentHands与纯语音基线系统进行比较。结果显示,AgentHands在位置感知(用户能更准确判断智能体指向哪里)、动作理解(用户能更清楚理解操作步骤)以及警示可察觉性(用户更容易注意到智能体的警告)三项关键指标上,均显著优于纯语音系统。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/O-6AX70O4K_TV1ggSjJntNLg0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券