arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3148 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3148 篇

2509.10129 2025-09-16 cs.CL cs.IR 67%

Towards Reliable and Interpretable Document Question Answering via VLMs

Alessio Chen, Simone Giovannini, Andrea Gemelli, Fabio Coppini, Simone Marinai

机构 * Università degli Studi di Firenze(佛罗伦萨大学)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07030 2025-09-16 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering

Amirhossein Abaskohi, Spandana Gella, Giuseppe Carenini, Issam H. Laradji

机构 * Department of Computer Science(计算机科学系) The University of British Columbia(不列颠哥伦比亚大学) ServiceNow Research(ServiceNow研究)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04162 2025-09-05 cs.AR 67%

Real Time FPGA Based Transformers & VLMs for Vision Tasks: SOTA Designs and Optimizations

Safa Mohammed Sali, Mahmoud Meribout, Ashiyana Abdul Majeed

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15376 2025-09-01 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Towards Understanding Camera Motions in Any Video

Zhiqiu Lin, Siyuan Cen, Daniel Jiang, Jay Karhade, Hewei Wang, Chancharik Mitra, Tiffany Ling, Yuhan Huang, Sifan Liu, Mingyu Chen, Rushikesh Zawar, Xue Bai, Yilun Du, Chuang Gan, Deva Ramanan

专题命中 视觉问答 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project site: https://linzhiqiu.github.io/papers/camerabench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19111 2025-08-27 cs.CL 67%

Do LVLMs Know What They Know? A Systematic Study of Knowledge Boundary Perception in LVLMs

Zhikai Ding, Shiyu Ni, Keping Bi

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16148 2025-08-25 cs.IR cs.CL cs.MM 67%

Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering

Ao Zhou, Zebo Gu, Tenghao Sun, Jiawen Chen, Mingsheng Tu, Zifeng Cheng, Yafeng Yin, Zhiwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract)

Comments This paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24164 2025-07-08 cs.MM 67%

SVLA: A Unified Speech-Vision-Language Assistant with Multimodal Reasoning and Speech Generation

Ngoc Dung Huynh, Mohamed Reda Bouadjenek, Imran Razzak, Hakim Hacid, Sunil Aryal

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15895 2025-06-24 cs.LG cs.AI cs.CL cs.CV 67%

Directional Gradient Projection for Robust Fine-Tuning of Foundation Models

Chengyue Huang, Junjiao Tian, Brisa Maneechotesuwan, Shivang Chopra, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10778 2025-06-13 cs.CV cs.AI cs.LG 67%

SlotPi: Physics-informed Object-centric Reasoning Models

Jian Li, Wan Han, Ning Lin, Yu-Liang Zhan, Ruizhi Chengze, Haining Wang, Yi Zhang, Hongsheng Liu, Zidong Wang, Fan Yu, Hao Sun

机构 * Renmin University of China(中国人民大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23242 2025-05-30 cs.CL 67%

ChartMind: A Comprehensive Benchmark for Complex Real-world Multimodal Chart Question Answering

Jingxuan Wei, Nan Xu, Junnan Zhu, Yanni Hao, Gaowei Wu, Bihui Yu, Lei Wang

机构 * Beijing Wenge Technology Co., Ltd.(北京文格科技有限公司) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(沈阳计算技术研究所,中国科学院) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉问答 :vision-language model(abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17399 2025-05-27 cs.CL 67%

FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow

Haoyu Sun, Huichen Will Wang, Jiawei Gu, Linjie Li, Yu Cheng

机构 * Tongji University(同济大学) University of Washington(华盛顿大学) Sun Yat-sen University(中山大学) Microsoft(微软) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21747 2025-03-28 cs.CV cs.AI cs.LG 67%

CTRL-O: Language-Controllable Object-Centric Visual Representation Learning

Aniket Didolkar, Andrii Zadaianchuk, Rabiul Awal, Maximilian Seitzer, Efstratios Gavves, Aishwarya Agrawal

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06511 2025-03-28 cs.CV cs.AI cs.LG 67%

MoReVQA: Exploring Modular Reasoning Models for Video Question Answering

Juhong Min, Shyamal Buch, Arsha Nagrani, Minsu Cho, Cordelia Schmid

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2024; updated NExT-GQA results in Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19794 2025-03-26 cs.CV cs.AI cs.LG 67%

PAVE: Patching and Adapting Video Large Language Models

Zhuoming Liu, Yiquan Li, Khoi Duc Nguyen, Yiwu Zhong, Yin Li

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09022 2025-03-05 cs.RO 67%

DART-LLM: Dependency-Aware Multi-Robot Task Decomposition and Execution using Large Language Models

Yongdong Wang, Runze Xiao, Jun Younes Louhi Kasahara, Ryosuke Yajima, Keiji Nagatani, Atsushi Yamashita, Hajime Asama

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract)

Comments The work was first submitted to an IEEE conference on September 15, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21271 2025-03-03 cs.CV cs.AI cs.LG 67%

Adaptive Keyframe Sampling for Long Video Understanding

Xi Tang, Jihao Qiu, Lingxi Xie, Yunjie Tian, Jianbin Jiao, Qixiang Ye

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20891 2025-02-19 cs.LG cs.AI cs.CV 67%

Bayesian Low-Rank LeArning (Bella): A Practical Approach to Bayesian Neural Networks

Bao Gia Doan, Afshar Shamsi, Xiao-Yu Guo, Arash Mohammadi, Hamid Alinejad-Rokny, Dino Sejdinovic, Damien Teney, Damith C. Ranasinghe, Ehsan Abbasnejad

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments This paper is accepted in AAAI'25", and the code is available at https://bnn-bella.github.io/BNN-Bella/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15245 2025-02-18 cs.CV cs.AI cs.LG 67%

Reasoning-Enhanced Object-Centric Learning for Videos

Jian Li, Pu Ren, Yang Liu, Hao Sun

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16232 2025-02-11 cs.CV cs.AI cs.LG 67%

Defeasible Visual Entailment: Benchmark, Evaluator, and Reward-Driven Optimization

Yue Zhang, Liqiang Jing, Vibhav Gogate

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02951 2025-02-06 cs.CV cs.AI cs.LG 67%

VQA-Levels: A Hierarchical Approach for Classifying Questions in VQA

Madhuri Latha Madaka, Chakravarthy Bhagvati

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06234 2025-01-28 cs.CV cs.AI cs.LG 67%

TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data

Jeremy Andrew Irvin, Emily Ruoyu Liu, Joyce Chuyi Chen, Ines Dormoy, Jinyoung Kim, Samar Khanna, Zhuo Zheng, Stefano Ermon

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17759 2024-12-24 cs.AI cs.CV cs.LG 67%

Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy

Priyaranjan Pattnayak, Hitesh Laxmichand Patel, Bhargava Kumar, Amit Agarwal, Ishan Banerjee, Srikant Panda, Tejaswini Kumar

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10726 2024-12-17 cs.CV cs.AI cs.LG cs.RO 67%

NoisyEQA: Benchmarking Embodied Question Answering Against Noisy Queries

Tao Wu, Chuhao Zhou, Yen Heng Wong, Lin Gu, Jianfei Yang

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15207 2024-11-26 cs.CV cs.AI cs.CL cs.LG 67%

Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training

Ameera Bawazir, Kebin Wu, Wenbin Li

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 15 pages, 2 figures, accepted by BMVC'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00029 2024-11-04 cs.CL cs.AI cs.CV cs.LG 67%

Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models

Donghoon Kim, Gusang Lee, Kyuhong Shim, Byonghyo Shim

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19144 2024-10-28 cs.CV cs.AI cs.CL cs.LG 67%

Visual Text Matters: Improving Text-KVQA with Visual Text Entity Knowledge-aware Large Multimodal Assistant

Abhirama Subramanyam Penamakuri, Anand Mishra

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to EMNLP (Main) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12244 2024-09-20 cs.CV cs.AI cs.LG 67%

Sparks of Artificial General Intelligence(AGI) in Semiconductor Material Science: Early Explorations into the Next Frontier of Generative AI-Assisted Electron Micrograph Analysis

Sakhinana Sagar Srinivas, Geethan Sannidhi, Sreeja Gangasani, Chidaksh Ravuru, Venkataramana Runkana

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published at Deployable AI (DAI) Workshop at AAAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.08395 2024-09-05 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

A Multimodal Memes Classification: A Survey and Open Research Issues

Tariq Habib Afridi, Aftab Alam, Muhammad Numan Khan, Jawad Khan, Young-Koo Lee

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments This is a survey paper on recent state of the art VL models that can be used for memes classification. it has 15 pages and 2 figures

Journal ref SCA 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00082 2024-09-04 cs.CL cs.AI cs.CV cs.LG 67%

Towards Human-Level Understanding of Complex Process Engineering Schematics: A Pedagogical, Introspective Multi-Agent Framework for Open-Domain Question Answering

Sagar Srinivas Sakhinana, Geethan Sannidhi, Venkataramana Runkana

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Our paper is accepted for publication at ML4CCE workshop at ECML PKDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13248 2024-08-26 cs.CV cs.AI cs.LG 67%

Foundational Model for Electron Micrograph Analysis: Instruction-Tuning Small-Scale Language-and-Vision Assistant for Enterprise Adoption

Sakhinana Sagar Srinivas, Chidaksh Ravuru, Geethan Sannidhi, Venkataramana Runkana

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Our paper is published at ICML 2024 Workshop ML for Life and Material Science: From Theory to Industry Applications, Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏