RAVEN: Resilient Aerial Navigation via Open-Set Semantic Memory and Behavior Adaptation
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Davidson College(戴维森学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Davidson College(戴维森学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Manipal University Jaipur(贾浦尔曼普尔大学) ; UNC–Charlotte(北卡罗来纳州立大学夏洛特分校) ; IIIT Hyderabad(海得拉巴印度理工学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 6 pages, 2 tables
机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系) ; Army Research Laboratory(陆军研究实验室) ; Sony AI(索尼人工智能)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Conference on Robot Learning (CoRL) 2025 Project site: https://amrl.cs.utexas.edu/ComposableNav/
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)
Comments Accepted by 2025 Recsys EARL Workshop
机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract)
Comments 8 pages, 5 figures, 3 tables
机构 * Centre for Advanced Robotics Technology Innovation (CARTIN), School of Electrical and Electronic Engineering, Nanyang Technological University(先进机器人技术创新中心(CARTIN)、电子与电气工程学院、南洋理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
机构 * UC San Diego(圣迭戈大学) ; Hillbot
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project Page: https://gen-vla.github.io/
机构 * School of Computer Science(计算机学院) ; Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering(智能交互与认知工程重点实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(Web3可信数据流通与治理上海市重点实验室) ; GenAI, Meta(Meta GenAI)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)
Comments ACL 2025
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
Comments Accepted to CoRL 2025. Project Page: https://gary3410.github.io/MoTo/
机构 * Tianjin University(天津大学) ; Dexmal ; Tsinghua University(清华大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
Comments The project is visible at https://linsun449.github.io/GeoVLA/
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Code at https://github.com/SunzeY/SEAgent
机构 * System Engineering Program, Cornell University(Cornell大学系统工程项目) ; School of Civil and Environmental Engineering, Cornell University(Cornell大学土木与环境工程学院) ; School of Electrical and Computer Engineering, Cornell University(Cornell大学电气与计算机工程学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
机构 * SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎精英技术研究所) ; Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) ; MoE Key Lab of Artificial Intelligence and AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能与AI研究所)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract)
Comments 6 figures, 2 tables, Accepted to Robotics: Science and Systems (RSS) 2025 Workshop on Robot Planning in the Era of Foundation Models (FM4RoboPlan)
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract)
机构 * University of Technology Nuremberg(图恩堡技术大学) ; UC Berkeley(伯克利大学) ; Google Research(谷歌研究)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments accepted to International Journal of Robotics Research (IJRR). 24 pages, 18 figures. The paper contains texts from VLMaps(arXiv:2210.05714) and AVLMaps(arXiv:2303.07522). The project page is https://mslmaps.github.io/
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract)
机构 * LLM-Core ; Xiaomi(小米)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract)
Comments 32 pages
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)
机构 * University of Michigan(密歇根大学) ; LG AI Research(LG人工智能研究)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR 2025
机构 * Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)
Comments 8 pages, 4 figures
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) ; Samsung R&D Institute China–Beijing(三星中国北京研发中心) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract)
机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科沃科学与技术研究所)
专题命中 GUI与屏幕智能体 :VLM(abstract);visual language model(abstract)
Comments arXiv admin note: text overlap with arXiv:2501.05014
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to Robotics: Science and Systems (RSS) 2025. Project website: https://openvla-oft.github.io/
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 18 pages, 13 figures, 8 tables
专题命中 GUI与屏幕智能体 :visual language model(abstract);grounding(abstract)
专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract)
Comments ICLR2025 Spotlight https://agenttrek.github.io
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 29 pages, 16 figures, technical report from MSR
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)
Comments In Proceedings of the SIGCHI Conference on Human Factors in Computing Systems (CHI '25)