MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization
MA-VLA:用于协作与组合泛化的多臂视觉-语言-动作模型
机构 * Dalian University of Technology(大连理工大学) ; University of Oxford(牛津大学) ; Sun Yat-sen University(中山大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Beihang University(北京航空航天大学)
AI总结 MA-VLA通过将协作行为分解为原子提示并引入Arm Shuffle训练方法,解决了多臂VLA模型的协作泛化问题,在未见过的协作模式下表现优于现有模型。
Comments ECCV 2026