Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
Evo-0:具有隐式空间理解的视觉-语言-动作模型
机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; EvoMind Tech(EvoMind科技) ; IAAR-Shanghai(IAAR-上海) ; University of Cambridge(剑桥大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV
AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。