arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3153 篇

2503.19498 2026-01-21 cs.CL 50%

DomainCQA: Crafting Knowledge-Intensive QA from Domain-Specific Charts

DomainCQA: 从领域特定图表中构建知识密集型问答

Yujing Lu, Ling Zhong, Jing Yang, Weiming Li, Peng Wei, Yongheng Wang, Manni Duan, Qing Zhang

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 DomainCQA通过构建领域特定图表问答基准测试,提升多模态大语言模型在视觉理解和知识密集型推理方面的能力。

Comments 83 pages, 59 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12700 2026-01-21 eess.AS cs.SD 50%

Improving Audio Question Answering with Variational Inference

通过变分推断改进音频问答

Haolin Chen

机构 * Idiap Research Institute, Martigny, Switzerland(日内瓦研究所) École Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(洛桑联邦理工学院)

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 本文通过改进的变分推断优化器提升音频问答任务的预测准确性与校准性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04720 2026-01-21 cs.CL 50%

Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking

Qwen3-VL-Embedding 和 Qwen3-VL-Reranker:面向最新多模态检索与排序的统一框架

Mingxin Li, Yanzhao Zhang, Dingkun Long, Keqin Chen, Sibo Song, Shuai Bai, Zhibo Yang, Pengjun Xie, An Yang, Dayiheng Liu, Jingren Zhou, Junyang Lin

专题命中 视觉问答 :visual question answering(abstract)

AI总结 Qwen3-VL-Embedding和Qwen3-VL-Reranker通过统一框架实现多模态检索与排序的高精度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10645 2026-01-16 cs.CL 50%

Influential Training Data Retrieval for Explaining Verbalized Confidence of LLMs

用于解释大语言模型 verbalized 自信心的有影响力训练数据检索

Yuxi Xia, Loris Schoenegger, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna, Vienna, Austria(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, Vienna, Austria(UniVie计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna, Vienna, Austria(维也纳大学语言与文化研究系)

专题命中 视觉问答 :grounding(abstract)

AI总结 TracVC通过追踪训练数据来解释LLMs表达自信心的来源,揭示了模型可能依赖无关数据模仿自信,而非真实内容基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22457 2025-12-30 cs.IR 50%

A Real-Time System to Populate FRA Form 57 from News

一种实时系统用于从新闻中填写FRA表单57

Chansong Lim, Haz Sameen Shahgir, Yue Dong, Jia Chen, Evangelos E. Papalexakis

专题命中 视觉问答 :vision language model(abstract)

AI总结 本文提出了一种实时系统,通过从新闻中提取信息来自动填写FRA表单57,解决了表单复杂性和新闻噪声问题。

Comments to be published in WSDM 2026 Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10440 2025-12-12 cs.CL 50%

Enhancing Next-Generation Language Models with Knowledge Graphs: Extending Claude, Mistral IA, and GPT-4 via KG-BERT

通过知识图谱增强下一代语言模型:通过KG-BERT扩展Claude、Mistral IA和GPT-4

Nour El Houda Ben Chaabene, Hamza Hammami

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) National Engineering School of Tunis(突尼斯国家工程学院) Faculty of Sciences of Tunis(突尼斯科学学院)

专题命中 视觉问答 :grounding(abstract)

AI总结 通过KG-BERT将知识图谱与Claude、Mistral IA和GPT-4结合,提升其事实可靠性与上下文感知能力。

Comments This paper was accepted and scheduled for inclusion in the ICALT 2025 proceedings but was ultimately not published due to absence from the conference presentation. It appears in the official program booklet. Conference: 2025 IEEE International Conference on Advanced Learning Technologies (ICALT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08944 2025-12-11 cs.CL 50%

Enhancing Reliability across Short and Long-Form QA via Reinforcement Learning

通过强化学习提升短篇和长篇问答的可靠性

Yudong Wang, Zhe Yang, Wenhan Ma, Zhifang Sui, Liang Zhao

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本研究通过强化学习框架减少短篇和长篇问答中的幻觉问题,提升模型可靠性与事实可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22141 2025-12-01 cs.CL 50%

Bridging the Modality Gap by Similarity Standardization with Pseudo-Positive Samples

通过伪正样本进行相似性标准化以弥合模态差距

Shuhei Yamashita, Daiki Shirafuji, Tatsuhiko Saito

机构 * Mitsubishi Electric Corporation(三菱电机公司)

专题命中 视觉问答 :vision-language model(abstract)

AI总结 通过伪正样本进行相似性标准化,有效弥合跨模态检索中的模态差距,提升检索性能。

Comments Accepted to PACLIC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20940 2025-11-27 cs.CL 50%

Chatty-KG: A Multi-Agent AI System for On-Demand Conversational Question Answering over Knowledge Graphs

Chatty-KG:一种用于基于知识图谱的按需对话问答的多智能体AI系统

Reham Omar, Abdelghny Orogat, Ibrahim Abdelaziz, Omij Mangukiya, Panos Kalnis, Essam Mansour

机构 * Concordia University(康科德大学) IBM Research(IBM研究院)

专题命中 视觉问答 :grounding(abstract)

AI总结 Chatty-KG通过多智能体系统实现基于知识图谱的对话问答,结合RAG检索与结构化执行,提升多轮问答的准确性和效率。

Comments This paper is accepted to SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20227 2025-11-26 cs.IR 50%

HKRAG: Holistic Knowledge Retrieval-Augmented Generation Over Visually-Rich Documents

HKRAG:面向视觉丰富文档的综合知识检索增强生成

Anyang Tong, Xiang Niu, ZhiPing Liu, Chang Tian, Yanyan Wei, Zenglin Shi, Meng Wang

专题命中 视觉问答 :visual question answering(abstract)

AI总结 HKRAG通过综合检索和生成机制,提升视觉丰富文档中显著与细节知识的检索与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20086 2025-11-26 cs.CL 50%

More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering

更多偏见,更少偏见:用于增强多项选择题回答的BiasPrompting

Duc Anh Vu, Thong Nguyen, Cong-Duy Nguyen, Viet Anh Nguyen, Anh Tuan Luu

机构 * Nanyang Techonological University(南洋理工大学) National University of Singapore(国立新加坡大学) Centre for AI research, VinUniversity(Vin大学人工智能研究中心)

专题命中 视觉问答 :grounding(abstract)

AI总结 BiasPrompting通过引导LLMs生成并评估所有可能答案的推理过程,提升多项选择题回答的推理能力,尤其在复杂问题中表现优异。

Comments Accepted at the 41st ACM/SIGAPP Symposium On Applied Computing (SAC 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08039 2025-11-05 cs.SD cs.CL cs.MM eess.AS 50%

Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning

Shu Wu, Chenxing Li, Wenfu Wang, Hao Zhang, Hualei Wang, Meng Yu, Dong Yu

专题命中 视觉问答 :multimodal large language model(abstract)

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03659 2025-11-04 cs.CL 50%

Trustworthy Medical Question Answering: An Evaluation-Centric Survey

Yinuo Wang, Baiyang Wang, Robert E. Mercer, Frank Rudzicz, Sudipta Singha Roy, Pengjie Ren, Zhumin Chen, Xindi Wang

机构 * Shandong University(山东大学) University of Western Ontario(西方大学) Dalhousie University(达尔豪斯大学) University of Toronto(多伦多大学)

专题命中 视觉问答 :grounding(abstract)

Comments accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09266 2025-10-13 cs.CL 50%

CFVBench: A Comprehensive Video Benchmark for Fine-grained Multimodal Retrieval-Augmented Generation

Kaiwen Wei, Xiao Liu, Jie Zhang, Zijian Wang, Ruida Liu, Yuming Yang, Xin Xiao, Xiao Sun, Haoyang Zeng, Changzai Pan, Yidan Zhang, Jiang Zhong, Peijin Wang, Yingchao Feng

机构 * Chongqing University(重庆大学) Independent Researcher(独立研究者) University of the Chinese Academy of Sciences(中国科学院大学) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 视觉问答 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07881 2025-10-10 cs.CL 50%

CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching

Heyang Liu, Yuhao Wang, Ziyang Cheng, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 视觉问答 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00579 2025-10-06 cs.MM cs.IR 50%

MHier-RAG: Multi-Modal RAG for Visual-Rich Document Question-Answering via Hierarchical and Multi-Granularity Reasoning

Ziyu Gong, Chengcheng Mai, Yihua Huang

专题命中 视觉问答 :vision-language model(abstract)

Comments Comments: Update Title, Author, Abstract, etc

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00161 2025-10-02 cs.CL 50%

TAMA: Tool-Augmented Multimodal Agent for Procedural Activity Understanding

Kimihiro Hasegawa, Wiradee Imrattanatrai, Masaki Asada, Ken Fukuda, Teruko Mitamura

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 视觉问答 :vision-language model(abstract)

Comments 21 pages. Code: https://github.com/kimihiroh/tama

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24120 2025-09-30 cs.CL 50%

EduVidQA: Generating and Evaluating Long-form Answers to Student Questions based on Lecture Videos

Sourjyadip Ray, Shubham Sharma, Somak Aditya, Pawan Goyal

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈格普尔) Panjab University, Chandigarh(旁遮普大学,昌迪加尔)

专题命中 视觉问答 :multimodal large language model(abstract)

Comments EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20007 2025-09-25 cs.CL 50%

DiffNator: Generating Structured Explanations of Time-Series Differences

Kota Dohi, Tomoya Nishida, Harsh Purohit, Takashi Endo, Yohei Kawaguchi

机构 * Research and Development Group, Hitachi, Ltd.(日立株式会社研发部)

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17961 2025-09-23 cs.CL 50%

Bringing Pedagogy into Focus: Evaluating Virtual Teaching Assistants' Question-Answering in Asynchronous Learning Environments

Li Siyan, Zhen Xu, Vethavikashini Chithrra Raghuram, Xuanming Zhang, Renzhe Yu, Zhou Yu

机构 * Columbia University(哥伦比亚大学)

专题命中 视觉问答 :grounding(abstract)

Comments Accepted in EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13835 2025-09-19 cs.CL 50%

RAcQUEt: Unveiling the Dangers of Overlooked Referential Ambiguity in Visual LLMs

Alberto Testoni, Barbara Plank, Raquel Fernández

机构 * Amsterdam UMC, Department of Medical Informatics(阿姆斯特丹大学医学中心,医学信息学系) Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML), Munich(慕尼黑机器学习中心(MCML)) Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学)

专题命中 视觉问答 :grounding(abstract)

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17471 2025-09-10 cs.CL 50%

FinRAGBench-V: A Benchmark for Multimodal RAG with Visual Citation in the Financial Domain

Suifeng Zhao, Zhuoran Jin, Sujian Li, Jun Gao

机构 * Key Laboratory of High Confidence Software Technologies, CS, Peking University, China(北京大学高可信软件技术重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimedia Information Processing, School of Computer Sciences, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 视觉问答 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19357 2025-08-28 cs.CL 50%

Context-Adaptive Synthesis and Compression for Enhanced Retrieval-Augmented Generation in Complex Domains

Peiran Zhou, Junnan Zhu, Yichen Shen, Ruoxi Yu

机构 * Kunming Medical University(昆明医科大学)

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18661 2025-08-27 cs.IR 50%

Extracting Information from Scientific Literature via Visual Table Question Answering Models

Dongyoun Kim, Hyung-do Choi, Youngsun Jang, John Kim

专题命中 视觉问答 :visual question answering(abstract)

Comments Accepted at ACM International Conference on Research in Adaptive and Convergent Systems, November 5-8, 2024, Pompei, Italy

Journal ref Proceedings of the ACM International Conference on Research in Adaptive and Convergent Systems (RACS 24), November 5-8, 2024, Pompei, Italy. ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17398 2025-08-26 cs.CL 50%

DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards

Aaryaman Kartha, Ahmed Masry, Mohammed Saidul Islam, Thinh Lang, Shadikur Rahman, Ridwan Mahbub, Mizanur Rahman, Mahir Ahmed, Md Rizwan Parvez, Enamul Hoque, Shafiq Joty

机构 * York University(约克大学) RBC Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所) Nanyang Technological University(南洋理工大学) Salesforce Research(Salesforce研究)

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18023 2025-08-26 cs.CL 50%

Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference

Zhuo Chen, Xinyu Wang, Yong Jiang, Zhen Zhang, Xinyu Geng, Pengjun Xie, Fei Huang, Kewei Tu

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(智能视觉与成像上海工程研究中心) Institute for Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)

专题命中 视觉问答 :visual question answering(abstract)

Comments EMNLP2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16139 2025-08-25 cs.CL 50%

XLQA: A Benchmark for Locale-Aware Multilingual Open-Domain Question Answering

Keon-Woo Roh, Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

专题命中 视觉问答 :grounding(abstract)

Comments Accepted to EMNLP 2025 main conference. 12 pages, 4 figures, 7 tables. Code is available at https://github.com/ro-ko/XLQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05182 2025-08-22 cs.IR 50%

On the Comprehensibility of Multi-structured Financial Documents using LLMs and Pre-processing Tools

Shivani Upadhyay, Messiah Ataey, Syed Shariyar Murtaza, Yifan Nie, Jimmy Lin

专题命中 视觉问答 :MLLM(abstract)

Comments 15 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04271 2025-08-07 cs.DC 50%

S2M3: Split-and-Share Multi-Modal Models for Distributed Multi-Task Inference on the Edge

JinYi Yoon, JiHo Lee, Ting He, Nakjung Choi, Bo Ji

专题命中 视觉问答 :visual question answering(abstract)

Comments Accepted at IEEE International Conference on Distributed Computing Systems (ICDCS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04585 2025-07-31 cs.CL 50%

MuSciClaims: Multimodal Scientific Claim Verification

Yash Kumar Lal, Manikanta Bandham, Mohammad Saqib Hasan, Apoorva Kashi, Mahnaz Koupaee, Niranjan Balasubramanian

机构 * Stony Brook University(石溪大学)

专题命中 视觉问答 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏