A Survey on Efficient Vision-Language-Action Models
高效视觉-语言-动作模型的综述
Zhaoshu Yu, Bo Wang, Pengpeng Zeng, Haonan Zhang, Ji Zhang, Zheng Wang, Lianli Gao, Jingkuan Song, Nicu Sebe, Heng Tao Shen
机构
*
School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
;
School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机科学与人工智能学院)
;
School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
;
Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)