DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) ; Tencent AI Lab(腾讯AI实验室) ; Robotics X, Tencent(腾讯机器人实验室) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments EMNLP 2025