M3ET: Efficient Vision-Language Learning for Robotics based on Multimodal Mamba-Enhanced Transformer
机构 * School of Software Northwestern Polytechnical University Xi'an, China(软件学院 西安理工大学 西安) ; Laboratoire L2Tl University Sorbonne Paris Nord Paris, France(L2Tl实验室 索邦巴黎北大学 巴黎)
专题命中 机器人多传感器融合 :information fusion(abstract);分类 cs.RO
Comments 8 pages