D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
D3D-VLP:动态3D视觉-语言-规划模型用于具身接地与导航
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 空间理解 :3D vision(title,abstract);分类 cs.CV、cs.RO
AI总结 D3D-VLP通过动态3D链式思维和协同学习策略,实现具身接地与导航的高效统一,提升多任务导航性能。