GUI-ReRank: Enhancing GUI Retrieval with Multi-Modal LLM-based Reranking
专题命中 GUI与屏幕智能体 :MLLM(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :MLLM(abstract)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments 9 pages, 5 figures
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
机构 * Beijing Institute of Technology, Beijing, P. R. China(北京理工大学) ; The University of Hong Kong, Hong Kong, P. R. China(香港大学)
专题命中 GUI与屏幕智能体 :vision language model(abstract)
Comments accepted to International Journal of Robotics Research(IJRR)
机构 * Shanghai Jiao Tong University(上海交通大学) ; OPPO Research Institute(OPPO研究院)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments A technical report on a GUI agent based on multi-agent systems
机构 * RoboPI Laboratory, Dept. of ECE, University of Florida (UF)(罗波实验室,电子工程系,佛罗里达大学) ; FOCUS Laboratory, Dept. of ECE, University of Florida (UF)(焦点实验室,电子工程系,佛罗里达大学) ; Amazon Robotics(亚马逊机器人技术)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments V2, includes suppl as appendix
机构 * K-Scale Labs(K-Scale实验室) ; McGill University(麦吉尔大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Journal ref IROS-MoMA3 Workshop 2024
机构 * University of Maryland, College Park MD, 20740, USA(马里兰大学) ; Goerge Mason University, Fairfax, VA, 22030, USA(乔治·马歇尔大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) ; Department of Information Sciences and Technology, George Mason University(信息科学与技术系,乔治·马歇尔大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments 11 pages,6 figures
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Westlake University(西湖大学) ; Monash University(墨尔本大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments 14 pages
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
机构 * Stanford University(斯坦福大学) ; Google DeepMind(谷歌DeepMind)
专题命中 GUI与屏幕智能体 :grounding(abstract)
Comments 16 pages, 13 figures
机构 * National University of Singapore(新加坡国立大学) ; Wuhan University(武汉大学) ; Zhejiang University(浙江大学) ; Nanjing University(南京大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments 8 pages, 7 figures
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments WWW' 2025
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beihang University(北航) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Samsung Research China(三星中国研究院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments 16 pages
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; Department of Engineering Science, Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院工程科学系) ; China Ship Research and Development Academy(中国船舶科研 Academy) ; Obuda University(奥布达大学) ; State Key Laboratory for Management and Control of Complex Systems, Chinese Academy of Sciences(中国科学院复杂系统管理与控制国家重点实验室)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
专题命中 GUI与屏幕智能体 :grounding(abstract)
Comments ICML 2025
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments Accepted to CHI 2025, in press. See the project page at mediacontentatlas.github.io
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments Accepted to MM4SG Workshop at The Web Conference 2025
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments Accepted as a conference paper at ICLR 2025
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments Accepted for IEEE RA-L 2025
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments This work has been submitted to the IEEE for possible publication. Project Page: https://toyotafrc.github.io/SketchMoMa-Proj
专题命中 GUI与屏幕智能体 :visual language model(abstract)
专题命中 GUI与屏幕智能体 :VLM(abstract)
Comments 13 pages, 7 figures
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
专题命中 GUI与屏幕智能体 :visual language model(abstract)
Comments CoRL 2024 camera ready. The first three authors contributed equally, and their order of authorship is interchangeable. Project page: https://care-maps.github.io/
专题命中 GUI与屏幕智能体 :grounding(abstract)
Comments Accepted by ICRA 2023