DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Pengcheng Laboratory(鹏城实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Meituan(美团)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.AI
机构 * Li Auto Inc.
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Benchmark: https://huggingface.co/datasets/LiAuto-DriveAction/drive-action
机构 * Sookmyung Women's University(首尔女子大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments 17 pages, 11 figures, 2 tables
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract)
机构 * China Mobile Research Institute(中国移动研究院) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; North China Electric Power University(华北电力大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)
机构 * University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学)
专题命中 幻觉与鲁棒性 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV、cs.AI
机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; National University of Singapore(新加坡国立大学) ; Sun Yat-sen University(中山大学) ; Beihang University(北京航空航天大学)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV
机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学) ; Science for Life Laboratory, Uppsala University(生命科学实验室,乌普萨拉大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.LG
专题命中 幻觉与鲁棒性 :grounding(abstract)
Comments Accepted by EMNLP 2025
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Word count: 5157, Table count: 2, Figure count: 5
机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) ; Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) ; Australian National University(澳大利亚国立大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
Comments Accepted to EMNLP-Findings 2025
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; College of Intelligence and Computing(智能与计算学院) ; Tianjin University(天津大学) ; School of Computer Science and Technology(计算机科学与技术学院) ; Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) ; Institute for Infocomm Research, A*STAR(信息通信研究机构,A*STAR) ; Show Lab, National University of Singapore(新加坡国立大学Show实验室) ; National University of Singapore(新加坡国立大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by NeurIPS 2025
机构 * Princeton University(普林斯顿大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);visual question answering(abstract)
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Innovation Institute(上海创新研究院) ; Alibaba Cloud(阿里巴巴云)
专题命中 VLM训练与架构 :vision-language model(abstract);visual language model(abstract);分类 cs.CV、cs.AI
Comments Code is available at https://github.com/InternLM/CapRL
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Sun Yat-sen University(中山大学)
专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI
机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究院) ; Skolkovo Institute of Science and Technology(斯克罗夫学院) ; Institute for Information Transmission Problems(信息传输问题研究所)
专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV、cs.AI
机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) ; Communication University of China(中国传媒大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.AI
机构 * University College London(伦敦大学学院) ; Institut Pasteur(巴斯德研究院)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI
Comments 9 pages, 6 figures. Accepted for publication in the Proceedings of the Artificial Life Conference 2025 (MIT Press)
机构 * Key Laboratory of Pervasive Computing, Tsinghua University(清华大学普适计算重点实验室) ; The University of New South Wales(新南威尔士大学) ; SKLSDE Lab, Beihang University(北航SKLSDE实验室)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; University of Central Florida(中央佛罗里达大学) ; Cisco Research(思科研究)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV