LA4VLA: Learning to Act without Seeing via Language-Action Pretraining
LA4VLA:通过语言-动作预训练实现无视觉行动学习
机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Alibaba Group(阿里巴巴集团) ; Nanyang Technological University(南洋理工大学) ; KAUST(阿卜杜拉国王科技大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO
AI总结 提出LA4VLA框架,通过语言-动作预训练学习动作先验,减少对视觉线索的依赖,提升VLA策略的鲁棒性,在仿真和真实任务中成功率显著提升。
Comments Github: https://github.com/MINT-SJTU/LA4VLA