FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
FantasyVLN: 一种统一的多模态链式推理框架用于视觉-语言导航
机构 * Fantasy AIGC Team(幻想AIGC团队) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV
AI总结 FantasyVLN通过统一的隐式推理框架实现视觉-语言导航的实时高效推理,结合多模态信息提升导航性能。