X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
机构 * Institute for AI Industry Research (AIR) Tsinghua University(人工智能产业研究院(AIR)清华大学) ; Shanghai AI Lab(上海人工智能实验室) ; Peking University(北京大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI
Comments preprint, technical report, 33 pages