Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) ; School of Data Science and Engineering, East China Normal University(东华师范大学数据科学与工程学院) ; School of Software Engineering, East China Normal University(东华师范大学软件工程学院) ; School of Computer Science, Fudan University(复旦大学计算机科学学院)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title,abstract);分类 cs.RO