An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges
视觉-语言-动作模型的解剖:从模块到里程碑与挑战
Chao Xu, Suyu Zhang, Yang Liu, Baigui Sun, Weihong Chen, Bo Xu, Qi Liu, Juncheng Wang, Shujun Wang, Shan Luo, Jan Peters, Athanasios V. Vasilakos, Stefanos Zafeiriou, Jiankang Deng
机构
*
IROOTECH TECHNOLOGY(IROOTECH技术公司)
;
Wolf 1069 b Lab, Sany Group(Sany集团沃尔夫1069b实验室)
;
Department of Engineering, King’s College London(伦敦国王学院工程系)
;
Hong Kong Polytechnic University(香港理工大学)
;
Computer Science Department of the Technische Universität Darmstadt(德累斯顿技术大学计算机科学系)
;
Department of ICT and Center for AI Research, University of Agder (UiA)(阿格德大学信息与通信技术系及人工智能研究中心)
;
Department of Computing, Imperial College London(伦敦帝国理工学院计算系)