PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation
PROSPECT:通过语义-空间融合和潜在预测表示实现统一的流式视觉-语言导航
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; University of Adelaide(阿德莱德大学) ; Wuhan University(武汉大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Beijing Jiaotong University(北京交通大学) ; AIR Wuxi Innovation Center, Tsinghua University(清华大学无锡创新中心) ; Lenovo(联想集团)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 PROSPECT通过语义-空间融合和潜在预测表示,实现统一的流式视觉-语言导航,提升环境动态和空间结构的预测能力。