MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
MiVLA:迈向具有人机互模仿预训练的通用视觉-语言-动作模型
机构 * Tongji University(同济大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO、cs.CV
AI总结 MiVLA通过人机互模仿预训练,提升视觉-语言-动作模型在现实与模拟环境中的泛化能力,实验显示其在模拟和现实任务中均优于现有方法。