Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Shanghai Jiao Tong University(上海交通大学) ; The University of Hong Kong(香港大学) ; Hunan Artificial Intelligence and Robotics Institute Company Ltd.(湖南人工智能与机器人研究院有限公司) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by IEEE Transactions on Neural Networks and Learning Systems