arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2511.06582 2026-02-03 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

TabRAG: Improving Tabular Document Question Answering for Retrieval Augmented Generation via Structured Representations

TabRAG:通过结构化表示改进表格文档问答以增强检索增强生成

Jacob Si, Mike Qu, Michelle Lee, Marek Rei, Yingzhen Li

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 TabRAG通过结构化表示改进表格文档问答,采用布局分割和视觉语言模型解析,提升表格问答性能。

Comments NeurIPS 2025 AI4Tab

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12505 2026-01-21 cs.CL 67%

DoPE: Decoy Oriented Perturbation Encapsulation Human-Readable, AI-Hostile Documents for Academic Integrity

DoPE: 伪装导向扰动封装用于学术诚信的人可读AI敌对文档

Ashish Raj Shekhar, Shiven Agarwal, Priyanuj Bordoloi, Yash Shah, Tejas Anvekar, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract)

AI总结 DoPE通过在考试文档中嵌入语义伪装,利用MLLM pipelines的渲染-解析差异,实现对AI自动解决的预防和检测,提升学术诚信保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14330 2025-12-29 cs.IR 67%

Ensembling Multiple Hallucination Detectors Trained on VLLM Internal Representations

集成多个基于VLLM内部表示的幻觉检测器

Yuto Nakamizo, Ryuhei Miyazato, Hikaru Tanabe, Ryuta Yamakura, Kiori Hatanaka

专题命中 视觉问答 :VLM(abstract);visual question answering(abstract)

AI总结 本文提出通过集成多个基于VLLM内部表示的幻觉检测模型,以减少幻觉并提高VQA任务的准确性。

Comments 5th place solution at Meta KDD Cup 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16891 2025-12-19 cs.CV cs.AI cs.IR cs.LG cs.MM 67%

LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation

LinkedOut: 从视频大语言模型中提取世界知识表示以实现下一代视频推荐

Haichao Zhang, Yao Lu, Lichen Wang, Yunzhe Li, Daiwei Chen, Yunpeng Xu, Yun Fu

机构 * Northeastern University(东北大学) LinkedIn(领英) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 LinkedOut通过从视频中提取世界知识表示,实现低延迟、多视频输入的视频推荐,无需人工标注,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19557 2025-11-26 cs.CV cs.AI cs.LG 67%

Think First, Assign Next (ThiFAN-VQA): A Two-stage Chain-of-Thought Framework for Post-Disaster Damage Assessment

先思后定(ThiFAN-VQA):一种用于灾后损害评估的两阶段链式思考框架

Ehsan Karimi, Nhut Le, Maryam Rahnemoonfar

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ThiFAN-VQA通过两阶段推理框架提升灾后损害评估的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13243 2025-11-18 cs.LG cs.AI cs.CV 67%

Uncovering and Mitigating Transient Blindness in Multimodal Model Editing

Xiaoqi Han, Ru Li, Ran Yi, Hongye Tan, Zhuomin Liang, Víctor Gutiérrez-Basulto, Jeff Z. Pan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25092 2025-10-30 cs.MA 67%

SeeingEye: Agentic Information Flow Unlocks Multimodal Reasoning In Text-only LLMs

Weijia Zhang, Zijia Liu, Haoru Li, Haoqi Chen, Jiaxuan You

专题命中 视觉问答 :VLM(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13253 2025-10-20 cs.CV cs.AI cs.LG 67%

End-to-End Multi-Modal Diffusion Mamba

Chunhao Lu, Qiang Lu, Meichen Dong, Jake Luo

机构 * China University of Petroleum-Beijing(中国石油大学(北京)) Leyard Optoelectronic(莱亚德光电) University of Wisconsin-Milwaukee(威斯康星大学密尔沃基分校)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12299 2025-10-15 cs.IR 67%

An Empirical Study for Representations of Videos in Video Question Answering via MLLMs

Zhi Li, Yanan Wang, Hao Niu, Julio Vizcarra, Masato Taya

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract)

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11101 2025-09-24 cs.CL 67%

Seeing is Not Understanding: A Benchmark on Perception-Cognition Disparities in Large Language Models

Haokun Li, Yazhou Zhang, Jizhi Ding, Qiuchi Li, Peng Zhang

机构 * Tianjin University(天津大学) Shandong Institute of Petroleum and Chemical Technology(山东石油化学工业技术研究所) Beijing Institute of Technology(北京理工大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract)

Comments I need to modify the content of the article

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10129 2025-09-16 cs.CL cs.IR 67%

Towards Reliable and Interpretable Document Question Answering via VLMs

Alessio Chen, Simone Giovannini, Andrea Gemelli, Fabio Coppini, Simone Marinai

机构 * Università degli Studi di Firenze(佛罗伦萨大学)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07030 2025-09-16 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering

Amirhossein Abaskohi, Spandana Gella, Giuseppe Carenini, Issam H. Laradji

机构 * Department of Computer Science(计算机科学系) The University of British Columbia(不列颠哥伦比亚大学) ServiceNow Research(ServiceNow研究)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04162 2025-09-05 cs.AR 67%

Real Time FPGA Based Transformers & VLMs for Vision Tasks: SOTA Designs and Optimizations

Safa Mohammed Sali, Mahmoud Meribout, Ashiyana Abdul Majeed

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15376 2025-09-01 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Towards Understanding Camera Motions in Any Video

Zhiqiu Lin, Siyuan Cen, Daniel Jiang, Jay Karhade, Hewei Wang, Chancharik Mitra, Tiffany Ling, Yuhan Huang, Sifan Liu, Mingyu Chen, Rushikesh Zawar, Xue Bai, Yilun Du, Chuang Gan, Deva Ramanan

专题命中 视觉问答 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project site: https://linzhiqiu.github.io/papers/camerabench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19111 2025-08-27 cs.CL 67%

Do LVLMs Know What They Know? A Systematic Study of Knowledge Boundary Perception in LVLMs

Zhikai Ding, Shiyu Ni, Keping Bi

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16148 2025-08-25 cs.IR cs.CL cs.MM 67%

Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering

Ao Zhou, Zebo Gu, Tenghao Sun, Jiawen Chen, Mingsheng Tu, Zifeng Cheng, Yafeng Yin, Zhiwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract)

Comments This paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24164 2025-07-08 cs.MM 67%

SVLA: A Unified Speech-Vision-Language Assistant with Multimodal Reasoning and Speech Generation

Ngoc Dung Huynh, Mohamed Reda Bouadjenek, Imran Razzak, Hakim Hacid, Sunil Aryal

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15895 2025-06-24 cs.LG cs.AI cs.CL cs.CV 67%

Directional Gradient Projection for Robust Fine-Tuning of Foundation Models

Chengyue Huang, Junjiao Tian, Brisa Maneechotesuwan, Shivang Chopra, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10778 2025-06-13 cs.CV cs.AI cs.LG 67%

SlotPi: Physics-informed Object-centric Reasoning Models

Jian Li, Wan Han, Ning Lin, Yu-Liang Zhan, Ruizhi Chengze, Haining Wang, Yi Zhang, Hongsheng Liu, Zidong Wang, Fan Yu, Hao Sun

机构 * Renmin University of China(中国人民大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23242 2025-05-30 cs.CL 67%

ChartMind: A Comprehensive Benchmark for Complex Real-world Multimodal Chart Question Answering

Jingxuan Wei, Nan Xu, Junnan Zhu, Yanni Hao, Gaowei Wu, Bihui Yu, Lei Wang

机构 * Beijing Wenge Technology Co., Ltd.(北京文格科技有限公司) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(沈阳计算技术研究所,中国科学院) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉问答 :vision-language model(abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17399 2025-05-27 cs.CL 67%

FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow

Haoyu Sun, Huichen Will Wang, Jiawei Gu, Linjie Li, Yu Cheng

机构 * Tongji University(同济大学) University of Washington(华盛顿大学) Sun Yat-sen University(中山大学) Microsoft(微软) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21747 2025-03-28 cs.CV cs.AI cs.LG 67%

CTRL-O: Language-Controllable Object-Centric Visual Representation Learning

Aniket Didolkar, Andrii Zadaianchuk, Rabiul Awal, Maximilian Seitzer, Efstratios Gavves, Aishwarya Agrawal

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06511 2025-03-28 cs.CV cs.AI cs.LG 67%

MoReVQA: Exploring Modular Reasoning Models for Video Question Answering

Juhong Min, Shyamal Buch, Arsha Nagrani, Minsu Cho, Cordelia Schmid

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2024; updated NExT-GQA results in Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19794 2025-03-26 cs.CV cs.AI cs.LG 67%

PAVE: Patching and Adapting Video Large Language Models

Zhuoming Liu, Yiquan Li, Khoi Duc Nguyen, Yiwu Zhong, Yin Li

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09022 2025-03-05 cs.RO 67%

DART-LLM: Dependency-Aware Multi-Robot Task Decomposition and Execution using Large Language Models

Yongdong Wang, Runze Xiao, Jun Younes Louhi Kasahara, Ryosuke Yajima, Keiji Nagatani, Atsushi Yamashita, Hajime Asama

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract)

Comments The work was first submitted to an IEEE conference on September 15, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21271 2025-03-03 cs.CV cs.AI cs.LG 67%

Adaptive Keyframe Sampling for Long Video Understanding

Xi Tang, Jihao Qiu, Lingxi Xie, Yunjie Tian, Jianbin Jiao, Qixiang Ye

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20891 2025-02-19 cs.LG cs.AI cs.CV 67%

Bayesian Low-Rank LeArning (Bella): A Practical Approach to Bayesian Neural Networks

Bao Gia Doan, Afshar Shamsi, Xiao-Yu Guo, Arash Mohammadi, Hamid Alinejad-Rokny, Dino Sejdinovic, Damien Teney, Damith C. Ranasinghe, Ehsan Abbasnejad

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments This paper is accepted in AAAI'25", and the code is available at https://bnn-bella.github.io/BNN-Bella/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15245 2025-02-18 cs.CV cs.AI cs.LG 67%

Reasoning-Enhanced Object-Centric Learning for Videos

Jian Li, Pu Ren, Yang Liu, Hao Sun

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16232 2025-02-11 cs.CV cs.AI cs.LG 67%

Defeasible Visual Entailment: Benchmark, Evaluator, and Reward-Driven Optimization

Yue Zhang, Liqiang Jing, Vibhav Gogate

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02951 2025-02-06 cs.CV cs.AI cs.LG 67%

VQA-Levels: A Hierarchical Approach for Classifying Questions in VQA

Madhuri Latha Madaka, Chakravarthy Bhagvati

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏