arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

TANGO:基于全身视觉-语言-动作模型的类人机器人在杂乱环境中的导航

TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

Anqi Li, Yuxin Chen, Zhaobo Li, Zhuo Cao, Junli Ren, Masayoshi Tomizuka, Dhruv Shah

arXiv 2609.09158首次发表:更新:

发表机构

University of California, Berkeley; Peking University; Tsinghua University; The University of Hong Kong; Princeton University(加州大学伯克利分校; 北京大学; 清华大学; 香港大学; 普林斯顿大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

TANGO提出首个全身视觉-语言导航框架,通过29自由度动作预测实现类人机器人在杂乱环境中的语言引导通行,仿真训练并零样本部署成功。

AI 中文摘要

我们研究了使用类人机器人在杂乱室内环境中导航的问题。与将导航建模为二维路径规划问题的传统方法不同,类人机器人在杂乱环境中的通行需要连续的、考虑几何信息的全身适应性调整,包括协调的手臂放置、躯干调整和步态调节,以实现通过复杂三维空间的无碰撞移动。我们提出了TANGO,这是第一个用于语言条件化类人机器人在杂乱环境中通行的全身视觉-语言导航框架。给定自然语言指令和以自我为中心的RGB观测,TANGO直接预测29自由度的关节空间动作,用于下游的全身控制。我们完全在仿真中训练TANGO,通过全局路径规划、运动学全身运动生成、障碍感知运动编辑和基于强化学习的跟踪,合成多样化的无碰撞通行行为。该流程为学习语言条件化的全身策略提供了动态可行的动作监督。在广泛的仿真实验中,TANGO在视觉-语言导航中展示了最先进的性能,同时在需要障碍协商的挑战性场景导航中优于强大的模块化基线。最后,我们将TANGO零样本部署在Unitree G1类人机器人上,并观察到在杂乱的真实世界场景中,无需任何真实世界导航数据训练即可实现稳健的语言引导通行。

英文摘要

We study the problem of navigating cluttered indoor environments with a humanoid robot. Unlike conventional methods that model navigation as a 2D path planning problem, humanoid traversal in cluttered environments requires continuous geometry-aware whole-body adaptation, including coordinated arm placement, torso adjustment, and gait modulation for collision-free movement through complex 3D spaces. We introduce TANGO, the first whole-body vision-language navigation framework for language-conditioned humanoid traversal in cluttered environments. Given a natural-language instruction and egocentric RGB observations, TANGO directly predicts 29-DoF joint-space actions for downstream whole-body control. We train TANGO entirely in simulation by synthesizing diverse collision-free traversal behaviors via global path planning, kinematic whole-body motion generation, obstacle-aware motion editing, and RL-based tracking. This pipeline provides dynamically feasible action supervision for learning language-conditioned whole-body policies. In extensive simulation experiments, TANGO demonstrates state-of-the-art performance in vision-language navigation, while outperforming strong modular baselines in navigating challenging scenes requiring obstacle negotiation. Lastly, we deploy TANGO zero-shot on a Unitree G1 humanoid robot, and observe robust language-guided traversal in cluttered real-world scenes without training on any real-world navigation data.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑