等变视觉-触觉扩散策略用于接触丰富操作
Equivariant Visual-Tactile Diffusion Policy for Contact-Rich Manipulation
浏览论文内容
中文总结 AI 辅助
提出VISTA,一种工作空间级等变视觉-触觉扩散策略,通过球形融合与谐波旋转实现数据高效的接触丰富模仿学习,实验证明其数据效率显著优于基线。
中文摘要 AI 辅助
接触丰富操作的模仿学习需要高质量专家数据,而这些数据获取成本高昂。这使得学习样本高效策略成为关键问题。为解决此问题,我们提出VISTA,一种工作空间级等变视觉-触觉扩散策略,用于数据高效的接触丰富模仿学习。VISTA将视觉和触觉观测投影为球形令牌,通过置换等变球形融合将触觉接触线索注入视觉球形方向,并利用末端执行器方向旋转融合后的谐波表示。所得表示条件化一个等变扩散策略,以预测空间一致的动作。在仿真和真实机器人环境中的大量实验表明,VISTA在数据效率上显著优于强视觉-触觉模仿学习基线。项目网站:此https URL
英文摘要
Imitation learning for contact-rich manipulation requires high-quality expert data that is expensive to obtain. This makes learning a sample-efficient policy a key issue. To address this, we propose VISTA, a workspace-level equivariant visuotactile diffusion policy for data-efficient contact-rich imitation learning. VISTA projects visual and tactile observations into spherical tokens, injects tactile contact cues into visual spherical directions through permutation-equivariant spherical fusion, and rotates the fused harmonic representation using the end-effector orientation. The resulting representation conditions an equivariant diffusion policy to predict spatially consistent actions. Extensive experiments in both simulation and real-world robotic settings show that VISTA substantially improves data efficiency over strong visuotactile imitation learning baselines. Project website: https://vista-paper.github.io/
发表机构
- The Chinese University of Hong Kong(香港中文大学)
- Southeast University(东南大学)
机构由 AI 辅助整理,请以论文原文为准。