An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges
视觉-语言-动作模型的解剖:从模块到里程碑与挑战
机构 * IROOTECH TECHNOLOGY(IROOTECH技术公司) ; Wolf 1069 b Lab, Sany Group(Sany集团沃尔夫1069b实验室) ; Department of Engineering, King’s College London(伦敦国王学院工程系) ; Hong Kong Polytechnic University(香港理工大学) ; Computer Science Department of the Technische Universität Darmstadt(德累斯顿技术大学计算机科学系) ; Department of ICT and Center for AI Research, University of Agder (UiA)(阿格德大学信息与通信技术系及人工智能研究中心) ; Department of Computing, Imperial College London(伦敦帝国理工学院计算系)
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
AI总结 本文系统分析了视觉-语言-动作模型的核心挑战,从模块构建到里程碑发展,为研究者提供结构化指南和未来研究方向。
Comments project page: https://suyuz1.github.io/VLA-Survey-Anatomy/