VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation
VT-MUSE:面向操作任务的多模态统一时序视觉-触觉表示学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xense Robotics(Xense机器人公司) ; BUPT(北京邮电大学)
AI总结 本研究提出VT-MUSE视觉-触觉多模态统一时序表示学习框架,通过两阶段学习解决现有方法的跨模态依赖捕获与时序接触演化忽略问题,在仿真和真实操作任务中性能优于基线