Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
Evo-0:具有隐式空间理解的视觉-语言-动作模型
机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; EvoMind Tech(EvoMind科技) ; IAAR-Shanghai(IAAR-上海) ; University of Cambridge(剑桥大学)
专题命中 空间理解 :spatial understanding(title,abstract);point cloud(abstract);分类 cs.CV、cs.RO
AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。