arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2506.06279 2025-06-09 cs.CV 70%

CoMemo: LVLMs Need Image Context with Image Memory

Shi Liu, Weijie Su, Xizhou Zhu, Wenhai Wang, Jifeng Dai

机构 * Shi Liu Weijie Su Xizhou Zhu Wenhai Wang Jifeng Dai

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18034 2025-06-02 cs.CV cs.CL 70%

Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models

Qiao Liang, Yanjiang Liu, Weixiang Zhou, Ben He, Yaojie Lu, Hongyu Lin, Jia Zheng, Xianpei Han, Le Sun, Yingfei Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室)

专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13199 2025-05-28 cs.CR cs.AI 70%

Building Trustworthy Multimodal AI: A Review of Fairness, Transparency, and Ethics in Vision-Language Tasks

Mohammad Saleh, Azadeh Tabatabaei

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

Journal ref International Journal of Web Research, vol.8, no.2,pp.11-24, 2025,

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15529 2025-05-22 cs.CV 70%

Clapper: Compact Learning and Video Representation in VLMs

Lingyu Kong, Hongzhi Zhang, Jingyuan Zhang, Jianzhao Huang, Kunze Li, Qi Wang, Fuzheng Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15477 2025-05-22 cs.CV 70%

MediConfusion: Can you trust your AI radiologist? Probing the reliability of multimodal medical foundation models

Mohammad Shahab Sepehri, Zalan Fabian, Maryam Soltanolkotabi, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering, University of Southern California(电气与计算机工程系,南加州大学) Department of Radiology and Imaging Sciences, University of Utah(放射学与影像科学系,犹他大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 24 Pages, 9 figures, The Thirteenth International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14627 2025-05-21 cs.AI cs.CL 70%

Debating for Better Reasoning: An Unsupervised Multimodal Approach

Ashutosh Adhikari, Mirella Lapata

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02413 2025-05-06 cs.AI 70%

Task-Oriented Semantic Communication in Large Multimodal Models-based Vehicle Networks

Baoxia Du, Hongyang Du, Dusit Niyato, Ruidong Li

机构 * Institute of Science and Engineering, Kanazawa University(金泽大学科学与工程研究所) Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09809 2025-04-23 cs.HC cs.AI 70%

See or Recall: A Sanity Check for the Role of Vision in Solving Visualization Question Answer Tasks with Multimodal LLMs

Zhimin Li, Haichao Miao, Xinyuan Yan, Valerio Pascucci, Matthew Berger, Shusen Liu

机构 * Vanderbilt University(范德比大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07556 2025-04-11 cs.CV 70%

TokenFocus-VQA: Enhancing Text-to-Image Alignment with Position-Aware Focus and Multi-Perspective Aggregations on LVLMs

Zijian Zhang, Xuhui Zheng, Xuecheng Wu, Chong Peng, Xuezhi Cao

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02244 2025-04-04 cs.CV 70%

SocialGesture: Delving into Multi-person Gesture Understanding

Xu Cao, Pranav Virupaksha, Wenqi Jia, Bolin Lai, Fiona Ryan, Sangmin Lee, James M. Rehg

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00654 2025-04-02 cs.CV 70%

QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA

Shuai Li, Jian Xu, Xiao-Hui Li, Chao Deng, Lin-Lin Huang

专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13164 2025-04-02 cs.LG 70%

VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning

Yongshuo Zong, Ondrej Bohdal, Timothy Hospedales

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21910 2025-03-31 cs.CL cs.AI 70%

JEEM: Vision-Language Understanding in Four Arabic Dialects

Karima Kadaoui, Hanin Atwany, Hamdan Al-Ali, Abdelrahman Mohamed, Ali Mekky, Sergei Tilga, Natalia Fedorova, Ekaterina Artemova, Hanan Aldarmaki, Yova Kementchedjhieva

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07411 2025-03-24 cs.CV cs.MM 70%

EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering

Sheng Zhou, Junbin Xiao, Qingyun Li, Yicong Li, Xun Yang, Dan Guo, Meng Wang, Tat-Seng Chua, Angela Yao

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08144 2025-03-21 cs.CV 70%

Bring Remote Sensing Object Detect Into Nature Language Model: Using SFT Method

Fei Wang, Chengcheng Chen, Hongyu Chen, Yugang Chang, Weiming Zeng

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10638 2025-03-20 cs.CV 70%

Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly

Yexin Liu, Zhengyang Liang, Yueze Wang, Xianfeng Wu, Feilong Tang, Muyang He, Jian Li, Zheng Liu, Harry Yang, Sernam Lim, Bo Zhao

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13317 2025-03-14 cs.CV 70%

Teaching VLMs to Localize Specific Objects from In-context Examples

Sivan Doveh, Nimrod Shabtay, Wei Lin, Eli Schwartz, Hilde Kuehne, Raja Giryes, Rogerio Feris, Leonid Karlinsky, James Glass, Assaf Arbelle, Shimon Ullman, M. Jehanzeb Mirza

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00901 2025-03-04 cs.CV 70%

FunBench: Benchmarking Fundus Reading Skills of MLLMs

Qijie Wei, Kaiheng Qian, Xirong Li

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18725 2025-02-27 cs.AI cs.CL q-bio.NC 70%

Talking to the brain: Using Large Language Models as Proxies to Model Brain Semantic Representation

Xin Liu, Ziyue Zhang, Jingxin Nie

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10674 2025-02-19 cs.CV cs.CL 70%

Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!

Mohamed Fazli Imam, Chenyang Lyu, Alham Fikri Aji

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Our dataset can be found at \url{https://huggingface.co/datasets/fazliimam/temporal-vqa}

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08862 2025-02-11 cs.LG 70%

Visual Agents as Fast and Slow Thinkers

Guangyan Sun, Mingyu Jin, Zhenting Wang, Cheng-Long Wang, Siqi Ma, Qifan Wang, Tong Geng, Ying Nian Wu, Yongfeng Zhang, Dongfang Liu

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.LG

Comments International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05452 2025-01-10 cs.CV cs.CL 70%

ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding

Xingyu Fu, Minqian Liu, Zhengyuan Yang, John Corring, Yijuan Lu, Jianwei Yang, Dan Roth, Dinei Florencio, Cha Zhang

专题命中 视觉问答 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Project link: https://zeyofu.github.io/ReFocus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17787 2024-12-24 cs.CV cs.CL 70%

Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective

Xinmiao Yu, Xiaocheng Feng, Yun Li, Minghui Liao, Ya-Qi Yu, Xiachong Feng, Weihong Zhong, Ruihan Chen, Mengkang Hu, Jihao Wu, Dandan Tu, Duyu Tang, Bing Qin

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16420 2024-12-24 cs.CV cs.CL 70%

Beyond End-to-End VLMs: Leveraging Intermediate Text Representations for Superior Flowchart Understanding

Junyi Ye, Ankan Dash, Wenpeng Yin, Guiling Wang

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08859 2024-12-13 cs.CV 70%

ViUniT: Visual Unit Tests for More Robust Visual Programming

Artemis Panagopoulou, Honglu Zhou, Silvio Savarese, Caiming Xiong, Chris Callison-Burch, Mark Yatskar, Juan Carlos Niebles

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10799 2024-12-10 cs.CV 70%

Towards Foundation Models for 3D Vision: How Close Are We?

Yiming Zuo, Karhan Kayan, Maggie Wang, Kevin Jeon, Jia Deng, Thomas L. Griffiths

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted to 3DV 2025. Update 12/09/24: Change the benchmark name to UniQA-3D, add link to code

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10669 2024-11-19 cs.CV 70%

Awaker2.5-VL: Stably Scaling MLLMs with Parameter-Efficient Mixture of Experts

Jinqiang Long, Yanqi Dai, Guoxing Yang, Hongpeng Lin, Nanyi Fei, Yizhao Gao, Zhiwu Lu

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04006 2024-11-07 cs.RO cs.AI 70%

Select2Plan: Training-Free ICL-Based Planning through VQA and Memory Retrieval

Davide Buoso, Luke Robinson, Giuseppe Averta, Philip Torr, Tim Franzmeyer, Daniele De Martini

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22648 2024-10-31 cs.CV 70%

SimpsonsVQA: Enhancing Inquiry-Based Learning with a Tailored Dataset

Ngoc Dung Huynh, Mohamed Reda Bouadjenek, Sunil Aryal, Imran Razzak, Hakim Hacid

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22029 2024-10-30 cs.CL cs.CV 70%

Are VLMs Really Blind

Ayush Singh, Mansi Gupta, Shivank Garg

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

Comments 2 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏