FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
FantasyVLN: 一种统一的多模态链式推理框架用于视觉-语言导航
机构 * Fantasy AIGC Team(幻想AIGC团队) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);planning(abstract)
AI总结 FantasyVLN通过统一的隐式推理框架实现视觉-语言导航的实时高效推理,结合多模态信息提升导航性能。