arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26172 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4484 篇

2412.12932 2025-03-11 cs.CV cs.AI 81%

CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models

Zihui Cheng, Qiguang Chen, Jin Zhang, Hao Fei, Xiaocheng Feng, Wanxiang Che, Min Li, Libo Qin

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at AAAI 2025; Project Page: https://github.com/czhhzc/CoMT

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00836 2025-02-25 cs.CV cs.AI cs.CL 81%

DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models

Chengke Zou, Xingang Guo, Rui Yang, Junyu Zhang, Bin Hu, Huan Zhang

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12381 2025-02-19 cs.CV cs.AI 81%

HumanEval-V: Benchmarking High-Level Visual Reasoning with Complex Diagrams in Coding Tasks

Fengji Zhang, Linquan Wu, Huiyu Bai, Guancheng Lin, Xiao Li, Xiao Yu, Yue Wang, Bei Chen, Jacky Keung

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI

Comments homepage https://humaneval-v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11968 2025-01-22 cs.AI cs.LG 81%

Bridging Visualization and Optimization: Multimodal Large Language Models on Graph-Structured Combinatorial Optimization

Jie Zhao, Kang Hao Cheong, Witold Pedrycz

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18319 2025-01-03 cs.CV cs.AI 81%

Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search

Huanjin Yao, Jiaxing Huang, Wenhao Wu, Jingyi Zhang, Yibo Wang, Shunyu Liu, Yingjie Wang, Yuxin Song, Haocheng Feng, Li Shen, Dacheng Tao

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15462 2024-12-23 cs.RO cs.AI cs.CL cs.HC cs.LG 81%

TalkWithMachines: Enhancing Human-Robot Interaction for Interpretable Industrial Robotics Through Large/Vision Language Models

Ammar N. Abbas, Csaba Beleznai

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.AI、cs.LG

Comments This paper has been accepted for publication in the proceedings of the 2024 Eighth IEEE International Conference on Robotic Computing (IRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12121 2024-12-17 cs.CL cs.AI cs.CV cs.MM 81%

IRR: Image Review Ranking Framework for Evaluating Vision-Language Models

Kazuki Hayashi, Kazuma Onishi, Toma Suzuki, Yusuke Ide, Seiji Gobara, Shigeki Saito, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 18pages, Accepted at COLING25

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10057 2024-11-07 cs.CV cs.AI 81%

First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models

Enming Zhang, Ruobing Yao, Huanyong Liu, Junhui Yu, Jiale Wang

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14852 2024-11-06 cs.CV cs.AI 81%

Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models

Jiayu Wang, Yifei Ming, Zhenmei Shi, Vibhav Vineet, Xin Wang, Yixuan Li, Neel Joshi

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02359 2024-11-05 cs.RO cs.AI cs.LG 81%

DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution

Yang Yue, Yulin Wang, Bingyi Kang, Yizeng Han, Shenzhi Wang, Shiji Song, Jiashi Feng, Gao Huang

专题命中 视觉推理 :multimodal large language model(title);MLLM(abstract);分类 cs.AI、cs.LG

Comments 25 pages, 6 figures, NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17041 2024-10-04 cs.CV cs.AI cs.CL 81%

Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties

Keunwoo Peter Yu, Zheyuan Zhang, Fengyuan Hu, Shane Storks, Joyce Chai

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 16 pages, LaTeX; Accepted to EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17150 2024-09-02 cs.CV cs.AI 81%

Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning

Xiaoye Qu, Jiashuo Sun, Wei Wei, Yu Cheng

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 13 pages, 7 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18626 2024-07-29 cs.CL cs.AI cs.CV cs.DL cs.MM 81%

Every Part Matters: Integrity Verification of Scientific Figures Based on Multimodal Large Language Models

Xiang Shi, Jiawei Liu, Yinpeng Liu, Qikai Cheng, Wei Lu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 28 pages, 11 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15487 2024-07-23 cs.CV cs.AI 81%

In-Context Learning Improves Compositional Understanding of Vision-Language Models

Matteo Nulli, Anesa Ibrahimi, Avik Pal, Hoshe Lee, Ivona Najdenkoska

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11300 2024-07-17 cs.CV cs.AI 81%

Large Vision-Language Models as Emotion Recognizers in Context Awareness

Yuxuan Lei, Dingkang Yang, Zhaoyu Chen, Jiawei Chen, Peng Zhai, Lihua Zhang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02537 2024-06-05 cs.CL cs.CV cs.LG 81%

TopViewRS: Vision-Language Models as Top-View Spatial Reasoners

Chengzu Li, Caiqi Zhang, Han Zhou, Nigel Collier, Anna Korhonen, Ivan Vulić

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments 9 pages, 3 figures, 3 tables (21 pages, 4 figures, 15 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03458 2024-06-04 cs.CV cs.LG 81%

Slot Abstractors: Toward Scalable Abstract Visual Reasoning

Shanka Subhra Mondal, Jonathan D. Cohen, Taylor W. Webb

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20795 2024-06-03 cs.CV cs.AI 81%

InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding

Huaxiang Zhang, Yaojia Mu, Guo-Niu Zhu, Zhongxue Gan

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10509 2024-04-02 cs.CL cs.AI cs.CV 81%

An Examination of the Compositionality of Large Generative Vision-Language Models

Teli Ma, Rong Li, Junwei Liang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10534 2024-03-19 cs.CV cs.AI 81%

VISREAS: Complex Visual Reasoning with Unanswerable Questions

Syeda Nahida Akter, Sangwu Lee, Yingshan Chang, Yonatan Bisk, Eric Nyberg

专题命中 视觉推理 :visual reasoning(title);LLaVA(abstract);分类 cs.CV、cs.AI

Comments 18 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00352 2024-03-04 cs.CV cs.LG 81%

Revisiting Disentanglement in Downstream Tasks: A Study on Its Necessity for Abstract Visual Reasoning

Ruiqian Nai, Zixin Wen, Ji Li, Yuanzhi Li, Yang Gao

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to AAAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11337 2024-01-23 cs.CV cs.AI 81%

Prompting Large Vision-Language Models for Compositional Reasoning

Timothy Ossowski, Ming Jiang, Junjie Hu

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06166 2024-01-01 cs.CV cs.AI 81%

Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning

Gengyuan Zhang, Yurui Zhang, Kerui Zhang, Volker Tresp

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19301 2023-10-31 cs.CL cs.AI cs.CV 81%

ROME: Evaluating Pre-trained Vision-Language Models on Reasoning beyond Visual Common Sense

Kankan Zhou, Eason Lai, Wei Bin Au Yeong, Kyriakos Mouratidis, Jing Jiang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments This is the camera-ready version of the paper that will be published in the EMNLP 2023 Findings (Singapore, 6-10 December 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15585 2023-10-25 cs.CL cs.CV cs.LG 81%

Multimodal Representations for Teacher-Guided Compositional Visual Reasoning

Wafa Aissa, Marin Ferecatu, Michel Crucianu

专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV、cs.LG

Journal ref Advanced Concepts for Intelligent Vision Systems, 21st International Conference (ACIVS 2023), Aug 2023, Kumamoto, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16705 2023-10-18 cs.CV cs.CL cs.LG 81%

Multimodal Analysis Of Google Bard And GPT-Vision: Experiments In Visual Reasoning

David Noever, Samantha Elizabeth Miller Noever

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09658 2023-08-22 cs.CL cs.AI cs.CV 81%

Tree-of-Mixed-Thought: Combining Fast and Slow Thinking for Multi-hop Visual Reasoning

Pengbo Hu, Ji Qi, Xingyu Li, Hong Li, Xinqi Wang, Bing Quan, Ruiyu Wang, Yi Zhou

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI

Comments 16 pages,1 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01668 2023-05-04 cs.CV cs.AI 81%

Visual Reasoning: from State to Transformation

Xin Hong, Yanyan Lan, Liang Pang, Jiafeng Guo, Xueqi Cheng

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by TPAMI. arXiv admin note: substantial text overlap with arXiv:2011.13160

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15006 2023-03-28 cs.CL cs.CV cs.LG 81%

Curriculum Learning for Compositional Visual Reasoning

Wafa Aissa, Marin Ferecatu, Michel Crucianu

专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV、cs.LG

Journal ref In Proceedings of the 18th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications - Volume 5: VISAPP, Feb 2023, Lisbon, Portugal. pp.888-897

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11559 2022-11-22 cs.CV cs.AI cs.CL 81%

Visual Programming: Compositional visual reasoning without training

Tanmay Gupta, Aniruddha Kembhavi

专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏