Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation
行动前预测:基于未来状态条件的视觉语言导航
机构 * Noah’s Ark Lab, 2012 Labs, Huawei(诺亚方舟实验室,2012实验室,华为)
AI总结 研究视觉语言导航中标准行为克隆问题,提出FSC-VLN方法,通过添加未来查询令牌并经训练后移除的目标分支将其隐藏状态与未来视觉嵌入对齐,实验表明该方法在R2R val-unseen上提升了相关指标。
Comments 9 pages, 1 figure, 4 tables