arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-09-01 至 2026-09-01 共收录 20 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 20 篇

2608.28762 2026-09-01 cs.CV 新提交 91%

Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering

Inter-3D VQA:用于3D时空视觉问答的路侧多模态基准

Shaozu Ding, Linan Song, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院)

专题命中 视觉问答 :visual question answering(title,abstract);VLM(summary_cn,abstract_cn);MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 本文提出用于交叉口3D时空视觉问答的路侧多模态基准Inter-3D VQA,构建含40.7万问答对的数据集,提出基线模型Inter-Geo与评估框架Inter-Metrics,实验显示Inter-Geo在接地时空推理任务上优于基于图像的VLM。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29037 2026-09-01 cs.CV cs.AI 新提交 89%

DocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering

DocIntent:面向真实场景文档视觉问答的可回答性引导智能体式恢复方法

Zihan Huang, Shihang Wu, Junle Liu, Peirong Zhang, Yongxin Shi, Xuhan Zheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 视觉问答 :visual question answering(title,abstract);MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对真实场景退化影响多模态大语言模型文档问答的问题,提出无需训练的DocIntent框架,通过评估可回答性、选择性调用恢复工具及比较式回滚机制,提升了各类MLLM在WildDoc基准上的表现。

Comments 25 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29865 2026-09-01 cs.CL 新提交 85%

ManGo: Manga Active Narrative Grounding Optimization

ManGo:漫画主动叙事定位优化

Hao Qiu, Junyan Wang, Zheyuan Liu, Lei Fan, Hong Jia, Lianbo Guo, Zhulin Tao

机构 * Communication University of China(中国传媒大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) University of New South Wales(新南威尔士大学) University of Auckland(奥克兰大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract)

AI总结 本研究针对漫画视觉问答的分镜叙事结构问题,提出无监督框架ManGo,通过主动叙事草图结合双奖励的组相对策略训练,在标准基准上取得最优性能。

Comments 16 pages, 9 figures, 7 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28707 2026-09-01 cs.CL cs.CV 新提交 84%

ReVA: A Region-Aware Visual Assistant for Visually Grounded Question Answering

ReVA:面向视觉接地问答的区域感知视觉助手

Anoop Senthil

专题命中 视觉问答 :grounding(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 该研究针对多模态大语言模型视觉问答中存在的物体幻觉问题,提出区域感知模型ReVA,通过双桥接结构融合整图与区域特征,在POPE数据集上将平均F1提升至82.85%,有效改善了视觉接地效果。

Comments 11 pages. Code: https://github.com/anoop675/reva

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07146 2026-09-01 cs.CV 版本更新 83%

Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering

学习搜索:一种基于决策的知识增强视觉问答代理

Zhuohong Chen, Zhenxian Wu, Yunyao Yu, Hangrui Xu, Zirui Liao, Zhifang Liu, Xiangwen Deng, Pen Jiao, Haoqian Wang

机构 * Tsinghua University(清华大学) University of Arizona(亚利桑那大学) Hefei University of Technology(合肥工业大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于决策的KB-VQA代理,通过多步骤决策过程解决视觉问答问题,改进检索与推理整合,提升对稀有实体和长尾事实的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30294 2026-09-01 cs.CV 新提交 81%

Dynamic Hub-and-Spoke Memory for Streaming Video Understanding

用于流视频理解的动态轮辐式记忆

Xinru Jiang, Lin Zhao, Xi Xiao, Yunbei Zhang, Janet Wang, Chenrui Ma, Haolin Li, Yanzhi Wang, Yifan Gong, Octavia Camps

机构 * Northeastern University(东北大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Tulane University(杜兰大学) University of Virginia(弗吉尼亚大学) Adobe Research(奥多比研究院)

专题命中 视觉问答 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 针对流视频理解需同时紧凑记忆长程历史与高效检索相关证据的挑战,提出动态轮辐式记忆(D-HSM)框架,结合结构化文本记忆与近期视觉标记,在基准上提升VLM性能并优于现有基线。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29489 2026-09-01 cs.CR cs.CV 新提交 81%

SpatialTrust: A Benchmark for Environmental Risk Recognition in Secure Authentication

SpatialTrust:安全认证中环境风险识别的基准测试

Junbin Lu, Hsiang-Wei Huang, Saesha Wadhwa, Yu Ting Hsu, Jenq-Neng Hwang

专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SpatialTrust基准测试评估MLLM在安全认证场景中环境风险识别等五项能力,发现现有模型表现有限,还引入SpatialTrustGuard流程提升了Qwen3-VL-30B-A3B-Instruct的性能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29408 2026-09-01 cs.CV cs.LG 新提交 81%

A Visual Question Answering Model to Automate Nondestructive Evaluation Image Analysis

用于自动化无损检测图像分析的视觉问答模型

Mehrdad Shafiei Dizaji, Hoda Azari

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究提出一种整合ResNet-50图像特征提取与GPT-2语言生成的VQA模型,用于自动化NDE图像分析,可提升检测效率、减少误差并增强现场可用性。

Comments 7, 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-09-01 cs.CV cs.AI 版本更新 81%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 视觉问答 :visual question answering(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29711 2026-09-01 cs.CL 新提交 80%

DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

DVBench:用于评估多模态大语言模型(MLLMs)理解数据视频中动态图表与叙事的基准

Bomiao Wang, Zekai Shao, Jiexiang Lan, Xiaoliang Fu, Xingchen Zeng, Siming Chen

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉问答 :MLLM(summary_cn,abstract)

AI总结 本研究推出DVBench基准,评估MLLMs在结合动态图表与叙事的数据视频理解上的表现,发现开源模型性能不严格随参数规模扩展等现象,为MLLM发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-09-01 cs.CV cs.LG 版本更新 79%

SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 14 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23443 2026-09-01 cs.CL 版本更新 78%

Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

重新审视视觉问答中的贪婪解码:一种校准视角

Boqi Chen, Xudong Liu, Yunke Ao, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MBZUAI(穆桑比克人工智能研究所)

专题命中 视觉问答 :visual question answering(title,abstract)

AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18676 2026-09-01 cs.CV cs.AI 版本更新 73%

MedVision: Benchmarking Quantitative Medical Image Analysis

MedVision:定量医学图像分析的基准测试

Yongcheng Yao, Yongshuo Zong, Raman Dutt, Yongxin Yang, Sotirios A Tsaftaris, Timothy Hospedales

机构 * University of Edinburgh(爱丁堡大学) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对当前医学视觉语言模型缺乏定量推理能力的问题,提出MedVision数据集和基准,涵盖22个公共数据集、3080万图像-标注对,通过监督和强化微调显著提升检测、肿瘤/病变大小估计和角度/距离测量性能。

Comments Paper accepted to EMNLP26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30758 2026-09-01 cs.CV 新提交 70%

CheXGround: Anatomical Region Tokens for Grounded Longitudinal Chest X-ray Interpretation

CheXGround:用于 grounded 纵向胸部 X 线片解读的解剖区域标记

Adonay Demewez Gebremedhin, Wessam Shehieb, Sara Alansari, Mohamad Alansari, Muzammal Naseer, Sajid Javed, Naoufel Werghi

机构 * Ajman University(阿治曼大学) University of Birmingham(伯明翰大学) Khalifa University(哈利法大学) University of Western Australia(西澳大学)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出 CheXGround,一种基于区域的纵向胸部 X 线片语言模型,通过时序区域-短语对齐预训练目标关联区域标记与临床文本,在多项放射学任务上较基线模型提升性能,验证了解剖层面组织纵向证据的有效性。

Comments Accepted for publication at the 37th British Machine Vision Conference (BMVC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30475 2026-09-01 cs.CL cs.AI 新提交 70%

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

ImageEval 2026:基于文化语境的阿拉伯语多模态评估

Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti, Farina Amir, Md Arid Hasan, Basel Mousi, Nadir Durrani, Fahim Dalvi, Zien Sheikh Ali, Erchin Serpedin, Hasan Kurban, Mustafa Jarrar, Shammur Absar Chowdhury, Firoj Alam

机构 * Texas A&M University(德克萨斯农工大学) Qatar Computing Research Institute(卡塔尔计算研究所) Birzeit University(比尔宰特大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学) University of Toronto(多伦多大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 ImageEval 2026共享任务含AynVQA和CRAI-Bench两项阿拉伯语多模态评估任务,14支团队参与,相关资源已发布,凸显文化语境多模态评估的挑战。

Comments Arabic LLMs, Multilingual, Multimodal, Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28635 2026-09-01 cs.CL cs.AI 新提交 70%

Do MLLMs Really Understand Low-Resource Khmer Documents? A Pilot Study on Khmer Document VQA

多模态大语言模型(MLLMs)真的理解低资源高棉语文档吗?一项关于高棉语文档视觉问答(VQA)的试点研究

Nimol Thuon, Panhapin Theang

机构 * University of Science and Technology of China(中国科学技术大学) Université Paris Cité(巴黎城市大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本研究针对高棉语文档VQA,评估开源MLLMs的性能,发现直接使用Qwen3-VL-8B准确率51.9%,外部OCR辅助的Tesseract、PaddleOCR分别达61.9%、61.6%,但高棉语文档理解仍存挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30289 2026-09-01 cs.RO 新提交 67%

CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding

CometVLA:基于具身数据金字塔的协同训练以实现物理理解

Hanwen Wan, Dafeng Chi, Linbo Zhai, Tianao Shen, Yuzheng Zhuang, Tianle Zhang, Peidong Liu, Liang Lin, Xiaoqiang Ji

机构 * JD Explore Academy(京东探索研究院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳市人工智能与机器人研究院) South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

专题命中 视觉问答 :VLM(abstract,abstract_cn)

AI总结 该研究提出CometVLA,通过构建与机器人动作对齐的具身物理VQA数据及引入GAP token,在具身数据金字塔上协同训练,提升VLA模型的物理理解能力,显著优于基线模型并验证了物理预训练对下游操作的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29088 2026-09-01 cs.AI 新提交 57%

HANIA: Planner-Guided Multimodal Graph Evidence Selection for Grounded Question Answering

HANIA:规划器引导的多模态图证据选择用于基于证据的问答

Zafar Ali, Asad Khan, Nimbeshaho Thierry, Nabila Amir, Adam A. Q. Mohammed, Pavlos Kefalas

机构 * Southeast University(东南大学) Portland Institute(波特兰研究所) Aristotle University of Thessaloniki(亚里士多德大学) Shandong University(山东大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出HANIA框架,通过规划器引导的多模态图证据选择处理ScienceQA问答任务,无需目标数据集微调或迭代检索即可实现具竞争力的多模态问答。

Comments 10 pages, 1 figure. Accepted at Graph-enhanced LLMs for trustwOrthy Web data management (GLOW), ISWC 2026 Workshops, Bari, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03471 2026-09-01 cs.CL cs.AI 版本更新 57%

EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning

EpiQAL:大型语言模型在流行病学问答与推理中的基准测试

Mingyang Wei, Dehai Min, Zewen Liu, Yuzhang Xie, Guanchen Wu, Ziyang Zhang, Carl Yang, Max S. Y. Lau, Qi He, Lu Cheng, Wei Jin

机构 * Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Microsoft(微软公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 提出EpiQAL基准,通过三个子集(事实回忆、多步推理、不完整信息下结论重建)评估LLM在流行病学推理中的表现,发现当前模型在多步推理上表现有限。

Comments Accepted to EMNLP 2026 Main Conference. 35 pages, 5 figures, 31 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16604 2026-09-01 eess.IV 版本更新 50%

Controlled Evaluation of Graph and Multimodal Augmentation in RAG for Document Question Answering

多模态和图增强的检索增强生成(RAG)何时有用?文档问答的对照评估

Sokipriala Jonah, Opeoluwa Akinseloyin, Michael Ajao-Olarinoye, Abiola Babatunde

专题命中 视觉问答 :visual question answering(abstract)

AI总结 研究文档问答中多模态和图增强RAG的作用,提出用多模态图-RAG架构,通过独立检索并融合文本、图和视觉证据源来评估效果。经实验发现其价值取决于多种因素,如检索设计等,还揭示了一些相关问题,如图像检索及生成器效率对结果的影响。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏