arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3157 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3157 篇

2503.17827 2025-03-25 cs.CV 57%

4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding

Wenxuan Zhu, Bing Li, Cheng Zheng, Jinjie Mai, Jun Chen, Letian Jiang, Abdullah Hamdi, Sara Rojas Martinez, Chia-Wen Lin, Mohamed Elhoseiny, Bernard Ghanem

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16032 2025-03-21 cs.CV 57%

Agentic Keyframe Search for Video Question Answering

Sunqi Fan, Meng-Hao Guo, Shuojin Yang

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15887 2025-03-21 cs.CV 57%

DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering

Haochen Wang, Kai Hu, Liangcai Gao

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10586 2025-03-18 cs.CV 57%

Unlock the Power of Unlabeled Data in Language Driving Model

Chaoqun Wang, Jie Yang, Xiaobin Hong, Ruimao Zhang

专题命中 视觉问答 :InternVL(abstract);分类 cs.CV

Comments Accepted by ICRA2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11481 2025-03-17 cs.CV 57%

T2I-FineEval: Fine-Grained Compositional Metric for Text-to-Image Evaluation

Seyed Mohammad Hadi Hosseini, Amir Mohammad Izadi, Ali Abdollahi, Armin Saghafian, Mahdieh Soleymani Baghshah

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted at ECCV 2024 Workshop EVAL-FoMo

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09590 2025-03-14 cs.CV 57%

BIMBA: Selective-Scan Compression for Long-Range Video Question Answering

Md Mohaiminul Islam, Tushar Nagarajan, Huiyu Wang, Gedas Bertasius, Lorenzo Torresani

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05780 2025-03-12 cs.LG stat.ML 57%

Breaking Neural Network Scaling Laws with Modularity

Akhilan Boopathy, Sunshine Jiang, William Yue, Jaedong Hwang, Abhiram Iyer, Ila Fiete

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07429 2025-03-11 cs.AI 57%

From Text to Visuals: Using LLMs to Generate Math Diagrams with Vector Graphics

Jaewook Lee, Jeongah Lee, Wanyong Feng, Andrew Lan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06380 2025-03-11 cs.CV cs.CL 57%

TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems

Khang H. N. Vo, Duc P. T. Nguyen, Thong Nguyen, Tho T. Quan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06296 2025-03-11 cs.CL cs.LG 57%

MoEMoE: Question Guided Dense and Scalable Sparse Mixture-of-Expert for Multi-source Multi-modal Answering

Vinay Kumar Verma, Shreyas Sunil Kulkarni, Happy Mittal, Deepak Gupta

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

Comments To appear at NAACL Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04095 2025-03-10 cs.CL cs.AI 57%

Chart-HQA: A Benchmark for Hypothetical Question Answering in Charts

Xiangnan Chen, Yuancheng Fang, Qian Xiao, Juncheng Li, Jun Lin, Siliang Tang, Yi Yang, Yueting Zhuang

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11006 2025-03-07 cs.CR cs.AI 57%

BackdoorMBTI: A Backdoor Learning Multimodal Benchmark Tool Kit for Backdoor Defense Evaluation

Haiyang Yu, Tian Xie, Jiaping Gui, Pengyang Wang, Ping Yi, Yue Wu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16486 2025-02-27 cs.CV 57%

MQADet: A Plug-and-Play Paradigm for Enhancing Open-Vocabulary Object Detection via Multimodal Question Answering

Caixiong Li, Xiongwei Zhao, Jinhang Zhang, Xing Zhang, Qihao Sun, Zhou Wu

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09906 2025-02-17 cs.CV 57%

Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding

Thanh-Dat Truong, Hoang-Quan Nguyen, Xuan-Bac Nguyen, Ashley Dowling, Xin Li, Khoa Luu

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09285 2025-02-14 cs.CV cs.CY 57%

EmoAssist: Emotional Assistant for Visual Impairment Community

Xingyu Qi, He Li, Linjie Li, Zhenyu Wu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05738 2025-02-11 cs.CV 57%

Performance Analysis of Traditional VQA Models Under Limited Computational Resources

Jihao Gu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 6 pages, 1 figure, 5 tabels, the paper has been accepted by the PRML'25 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15453 2025-02-07 cs.CL cs.CV 57%

CROPE: Evaluating In-Context Adaptation of Vision and Language Models to Culture-Specific Concepts

Malvina Nikandrou, Georgios Pantazopoulos, Nikolas Vitsakis, Ioannis Konstas, Alessandro Suglia

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02449 2025-02-05 cs.CV 57%

TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes

Xingcheng Zhou, Konstantinos Larintzakis, Hao Guo, Walter Zimmer, Mingyu Liu, Hu Cao, Jiajie Zhang, Venkatnarayanan Lakshminarasimhan, Leah Strand, Alois C. Knoll

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01292 2025-02-04 cs.CV 57%

LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences

Hongyan Zhi, Peihao Chen, Junyan Li, Shuailei Ma, Xinyu Sun, Tianhang Xiang, Yinjie Lei, Mingkui Tan, Chuang Gan

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14520 2025-01-27 eess.SP cs.CV 57%

Scene Understanding Enabled Semantic Communication with Open Channel Coding

Zhe Xiang, Fei Yu, Quan Deng, Yuandi Li, Zhiguo Wan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07214 2025-01-14 cs.CV 57%

TimeLogic: A Temporal Logic Benchmark for Video QA

Sirnam Swetha, Hilde Kuehne, Mubarak Shah

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06189 2025-01-14 cs.AI cs.CL 57%

A Multimodal Social Agent

Athina Bikaki, Ioannis A. Kakadiaris

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12926 2025-01-14 cs.AI 57%

MM-PhyRLHF: Reinforcement Learning Framework for Multimodal Physics Question-Answering

Janak Kapuriya, Chhavi Kirtani, Apoorv Singh, Jay Saraf, Naman Lal, Jatin Kumar, Adarsh Raj Shivam, Astha Verma, Avinash Anand, Rajiv Ratn Shah

专题命中 视觉问答 :LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19304 2024-12-30 cs.CV 57%

Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries

Roberto Amoroso, Gengyuan Zhang, Rajat Koner, Lorenzo Baraldi, Rita Cucchiara, Volker Tresp

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15574 2024-12-23 cs.CV 57%

J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM

Takero Yoshida, Yuikazu Ito, Yoshihiro Fujiwara, Shinji Tsuchida, Daisuke Sugiyama, Daisuke Matsuoka

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15514 2024-12-23 cs.CV cs.MM 57%

PolySmart @ TRECVid 2024 Medical Video Question Answering

Jiaxin Wu, Yiyang Jiang, Xiao-Yong Wei, Qing Li

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14880 2024-12-20 cs.CV 57%

Multimodal Hypothetical Summary for Retrieval-based Multi-image Question Answering

Peize Li, Qingyi Si, Peng Fu, Zheng Lin, Yan Wang

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13736 2024-12-19 cs.CV 57%

MedCoT: Medical Chain of Thought via Hierarchical Expert

Jiaxiang Liu, Yuan Wang, Jiawei Du, Joey Tianyi Zhou, Zuozhu Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Journal ref EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12502 2024-12-18 cs.CV 57%

Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues

Yan Zhang, Gangyan Zeng, Huawen Shen, Daiqing Wu, Yu Zhou, Can Ma

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12077 2024-12-17 cs.CV 57%

CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational Pathology

Yuxuan Sun, Yixuan Si, Chenglu Zhu, Xuan Gong, Kai Zhang, Pingyi Chen, Ye Zhang, Zhongyi Shui, Tao Lin, Lin Yang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏