arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

清华等让宇树G1边听边做手势,数据集覆盖300多类动作

作者:arXivDaily编辑部 arXiv 2608.28693 cs · cs.CV · cs.RO

清华大学、Galbot、北京大学和上海期智研究院等机构联合提出RoboGesture,让宇树G1人形机器人在听取语音时实时生成与内容相符的手势。团队同时建设了覆盖300多类动作的数据集,并把语音理解、流式动作生成和实体安全控制接成一套完整系统。

这项工作关注的不是预先录好一段挥手动画,而是机器人如何在对话进行时决定何时抬手、动作幅度多大、语义应指向哪里。论文在宇树G1实体硬件上完成实验,比较结果显示,RoboGesture生成的动作在安全性、节奏和语义匹配上优于论文采用的基线。

300多类动作先补齐机器人语言

伴随语音手势的数据长期来自真人动作捕捉,但人的关节范围、身体比例和自碰撞条件与人形机器人并不相同。把真人动作直接映射到机器人,可能出现手臂穿过躯干、关节越界,或者为了安全被大幅削弱,最终只剩下缺少表达力的小幅摆动。

RoboGesture数据管线先收集语义丰富的手势类别,再为机器人本体重定向并检查碰撞,形成音频与机器人动作配对。300多类并不是300条孤立片段,而是覆盖指示、强调、节奏配合等多种表达意图的类别基础。自动化合成流程进一步扩展无碰撞样本,减少逐条在真机上录制的成本。

图:项目页展示的RoboGesture数据构建、语音对齐、动作生成与安全执行流程。

动作越顺,模型反而越可能不听声音

连续动作模型很容易沿用上一时刻的姿态,因为历史运动已经提供了强预测信号。这样生成的视频看起来平滑,机器人却可能忽略新一句话的语义,反复做相似动作。论文把这种现象称为“模态遮蔽”:运动惯性盖过了音频条件。

为此,系统先用分层语义—声学对齐器从原始音频标记中提取不同时间尺度的韵律和语义,再把这些条件送入基于扩散Transformer与条件流匹配的流式生成器。Anti-Inertia CFG Masking会主动削弱历史动作这条捷径,迫使模型继续从声音中寻找控制信号。它解决的不是动作是否连贯,而是连贯之后还能否随内容及时转向。

图:项目页给出的RoboGesture数据集动作类别与机器人手势示例。

生成之后还有一道真机安全门

能生成动作序列,不等于可以直接驱动实体机器人。语义模型关注表达效果,真机执行还要处理关节速度、碰撞距离和实时控制延迟。RoboGesture在生成器之后加入基于模型预测控制的安全过滤器,逐步检查并修正可能造成自碰撞或超出硬件约束的动作。

论文的定性结果同时展示了基线与RoboGesture在不同语音片段下的表现。改进不仅体现在“动得更多”,还包括手势与语义对应、节奏落点以及动作可执行性。实体G1实验证明这条链路能够实时运行,但结论仍限于论文设置和测试语句,不能外推为开放环境中所有对话都可稳定生成。

图:项目页展示的RoboGesture与其他方法在语音手势生成上的定性对比。

从演示动作走向持续对话

RoboGesture把数据、生成和控制放在同一个机器人中心框架里,为导览、接待和协作场景提供了更自然的非语言表达接口。下一步值得观察的是,更长对话中手势是否会保持多样性,以及面对口音、噪声和突然打断时,系统能否维持低延迟与安全边界。

团队公开了项目页,并链接了相关机器人动作重定向工具。若数据和控制接口继续开放,研究者可以在不同本体上复核:同一句话换到不同尺寸、关节结构的机器人后,语义一致的手势应如何保留,同时又不牺牲真机安全。

对实际交互系统而言,还应分别记录生成延迟、安全过滤触发频率与用户对手势自然度的判断,避免只用单一动作相似度代表完整体验。

参考资料

https://arxiv.org/abs/2608.28693

https://RoboGesture.github.io

https://github.com/YanjieZe/GMR