D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
D3D-VLP:动态3D视觉-语言-规划模型用于具身接地与导航
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);manipulation(abstract);分类 cs.RO、cs.CV
AI总结 D3D-VLP通过动态3D链式思维和协同学习策略,实现具身接地与导航的高效统一,提升多任务导航性能。