Oedipus and the Sphinx: Benchmarking and Improving Visual Language Models for Complex Graphic Reasoning
机构 * Beijing Electronic Science & Technology Institute(北京电子科学技术研究所)
专题命中 视觉推理 :visual language model(title,abstract);VLM(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Beijing Electronic Science & Technology Institute(北京电子科学技术研究所)
专题命中 视觉推理 :visual language model(title,abstract);VLM(abstract);分类 cs.AI
机构 * Xiamen University(厦门大学) ; Zhongguancun Academy(中关村学院)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV
Comments ACM MM25 has accepted this paper
机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) ; Tianjin University(天津大学) ; Nanjing University(南京大学) ; Aalto University(艾尔沃斯大学)
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
机构 * Artificial Intelligence and Learning Systems Laboratory, National Technical University of Athens(人工智能与学习系统实验室,国家技术大学)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
机构 * Bosch Research North America(博世北美研究部) ; Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) ; Texas A&M University(德克萨斯A&M大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
机构 * Sun Yat-sen University(中山大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Shanghai Jiaotong University(上海交通大学) ; University of Hong Kong(香港大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:2411.11930
机构 * College of Computing, Georgia Institute of Technology(计算学院、佐治亚理工学院)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.LG
机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(自动化研究所)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
Comments 45 pages, accepted by CVPR2025
专题命中 视觉定位与Grounding :grounding(title,abstract)
Comments To appear in EDBT '24
机构 * 1 Department of Communication Systems, Jo z ef Stefan Institute, Slovenia ; Jozef Stefan Institute, Ljubljana, Slovenia
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
Comments Accepted at IEEE SmartGridComm'24
机构 * Sun Yat-sen University(中山大学) ; ByteDance Intelligent Creation(字节跳动智能创作) ; University of Surrey(Surrey大学) ; Alibaba Cloud Computing(阿里巴巴云计算)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
Comments Accepted to ICCV 2025
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
机构 * Meituan(美团)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
机构 * Beijing University of Technology(北京理工大学) ; Chinese Academy of Sciences(中国科学院) ; Capital Medical University(首都医科大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
机构 * MICS, CentraleSupélec - Université Paris-Saclay, France(MICS,中央圣艾尔布兰大学-巴黎萨克雷大学,法国) ; Google DeepMind, London, UK(谷歌DeepMind,伦敦,英国) ; CONICET, Universidad de Buenos Aires, Argentina(CONICET,布宜诺斯艾利斯大学,阿根廷)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV;multimodal large language model(comments)
Comments Accepted to MICCAI 2025 1st Workshop on Multimodal Large Language Models (MLLMs) in Clinical Practice
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract)
Comments 19 pages, 6 figures
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; BUPT(北京邮电大学) ; ByteDance(字节跳动)
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV
Comments Project page: https://llava-vl.github.io/blog/2024-09-30-llava-video/; Accepted at TMLR
机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang 大学计算机科学与工程学院) ; School of Computer Science, University of Birmingham(布拉德福德大学计算机科学学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to ICCV 2025
机构 * Stanford University(斯坦福大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments ICCV 2025, project page: https://web.stanford.edu/~markendo/projects/feather
机构 * EEEI, University of the Philippines(电子工程学院,菲律宾大学) ; AI Graduate Program, University of the Philippines(人工智能研究生项目,菲律宾大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
Comments 14 pages, accepted in ICCV 2025 Workshop on RetailVision
机构 * Department of Energy Technology(能源技术系) ; Aalborg University(奥尔堡大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments 11 pages, 8 figures
机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(合作中位网创新中心,上海交通大学) ; School of Artificial Intelligence, Shanghai Jiao Tong University(人工智能学院,上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beijing Institute of Technology(北京理工大学) ; A*STAR Centre for Frontier AI Research(A*STAR前沿人工智能研究中心)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 16 pages, Accepted at IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments To appear in ICCV 2025
机构 * FAIR, Meta(FAIR与Meta公司) ; MIT(麻省理工学院) ; Princeton University(普林斯顿大学) ; New York University(纽约大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
Comments 10 pages
专题命中 VLM训练与架构 :vision language model(abstract)
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tencent AI Lab(腾讯AI实验室)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV
Comments 9 pages