arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2610.03333cs.ROcs.AI

等变视觉-触觉扩散策略用于接触丰富操作

Equivariant Visual-Tactile Diffusion Policy for Contact-Rich Manipulation

Lik Hang Kenny Wong, Yiyao Ma, Xiu-Shen Wei, Zelong Tan, Zhuheng Song, Dongsheng Xie, Kai Chen, Qi Dou

首次发表
浏览论文内容

中文总结 AI 辅助

提出VISTA,一种工作空间级等变视觉-触觉扩散策略,通过球形融合与谐波旋转实现数据高效的接触丰富模仿学习,实验证明其数据效率显著优于基线。

中文摘要 AI 辅助

接触丰富操作的模仿学习需要高质量专家数据,而这些数据获取成本高昂。这使得学习样本高效策略成为关键问题。为解决此问题,我们提出VISTA,一种工作空间级等变视觉-触觉扩散策略,用于数据高效的接触丰富模仿学习。VISTA将视觉和触觉观测投影为球形令牌,通过置换等变球形融合将触觉接触线索注入视觉球形方向,并利用末端执行器方向旋转融合后的谐波表示。所得表示条件化一个等变扩散策略,以预测空间一致的动作。在仿真和真实机器人环境中的大量实验表明,VISTA在数据效率上显著优于强视觉-触觉模仿学习基线。项目网站:此https URL

英文摘要

Imitation learning for contact-rich manipulation requires high-quality expert data that is expensive to obtain. This makes learning a sample-efficient policy a key issue. To address this, we propose VISTA, a workspace-level equivariant visuotactile diffusion policy for data-efficient contact-rich imitation learning. VISTA projects visual and tactile observations into spherical tokens, injects tactile contact cues into visual spherical directions through permutation-equivariant spherical fusion, and rotates the fused harmonic representation using the end-effector orientation. The resulting representation conditions an equivariant diffusion policy to predict spatially consistent actions. Extensive experiments in both simulation and real-world robotic settings show that VISTA substantially improves data efficiency over strong visuotactile imitation learning baselines. Project website: https://vista-paper.github.io/

发表机构

  • The Chinese University of Hong Kong(香港中文大学)
  • Southeast University(东南大学)

机构由 AI 辅助整理,请以论文原文为准。

补充信息

↑