arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2606.03269 2026-06-29 cs.AI 版本更新 79%

Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answering

从LLM中蒸馏答案集编程规则用于神经符号视觉问答

Thomas Eiter, Nelson Higuera Ruiz, Johannes Oetsch

机构 * Vienna University of Technology ( TU Wien )(维也纳技术大学) Jönköping University(约克灵厄普大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

AI总结 提出从大语言模型中蒸馏答案集编程规则的方法,以可解释的方式扩展视觉问答系统的推理能力,仅需少量示例即可生成正确规则。

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22497 2026-06-25 cs.CV 新提交 79%

Benchmarking Vision-Language Models for Microscopic Plant Image Understanding

用于植物显微图像理解的视觉语言模型基准测试

Tianqi Wei, Xin Yu, Zhi Chen, Scott Chapman, Zi Huang

机构 * The University of Queensland(昆士兰大学) Adelaide University(阿德莱德大学) University of Southern Queensland(南昆士兰大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出PlantMicro基准,包含5000+图像和9000+VQA对,评估视觉语言模型在植物显微图像理解上的能力,发现现有模型在细粒度识别和生物学推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04554 2026-06-25 cs.CV 版本更新 79%

Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering

伪造答案:针对无OCR文档视觉问答的对抗性伪造

Marco Pintore, Maura Pintor, Dimosthenis Karatzas, Battista Biggio

机构 * University of Cagliari, Italy(卡利亚里大学) Computer Vision Center, UAB, Spain(UAB计算机视觉中心)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 提出一种视觉上不可察觉但语义上定向的对抗攻击方法,通过伪造文档内容诱导DocVQA模型产生错误答案,在Pix2Struct和Donut模型上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08787 2026-06-23 cs.CV 版本更新 79%

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

迷失于体积:CT-SpatialVQA基准用于评估3D医学视觉-语言模型的语义-空间理解

Mashrafi Monon, Umaima Rahman, Asif Hanif, Numan Saeed, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出CT-SpatialVQA基准,评估3D医学视觉-语言模型对3DCT数据的语义-空间理解能力,发现现有模型在语义-空间推理任务中表现不佳,需更深入整合体积证据以确保临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14702 2026-06-18 cs.CV 新提交 79%

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

OmniVideo-100K:通过结构化脚本和证据链进行音视频推理的数据集

Xinyue Cai, Chaoyou Fu, Yi-Fan Zhang, Ran He, Caifeng Shan

机构 * Nanjing University(南京大学) CASIA(中国科学院自动化研究所)

专题命中 视觉问答 :visual reasoning(title);visual question answering(abstract);分类 cs.CV

AI总结 提出OmniVideo-100K数据集,通过实体锚定视频脚本和线索引导的QA生成机制,解决音视频问答中跨段实体不一致和长时推理不足的问题,微调模型在多个基准上取得显著提升。

Comments Project page: https://github.com/MiG-NJU/OmniVideo-100K

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06534 2026-06-08 eess.IV cs.AI 新提交 79%

Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models

基于视觉基础模型的注意力一致纵向医学视觉问答

Jialin Wu, Qianru Zhang, Georges El Fakhri, Xiaofeng Liu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Yale Biomedical Imaging Institute(耶鲁大学生物医学成像研究所)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

AI总结 提出一种注意力引导的编码器-解码器框架,通过轻量级配准和自适应掩码生成,结合辅助损失函数,实现胸部X光片的纵向医学视觉问答,在Medical-Diff-VQA基准上取得优异性能。

Comments Accepted to CVPR 2026 Workshop PHAROS-AIF-MIH

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6448-6458

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02171 2026-06-02 cs.CV 79%

InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark

InsightVQA: 高维情感认知视觉问答基准

Shiyu Wang, Ziyu Liu, Chaoyi Yu, Yujie Yin, Zhongqian Mao, Jing Chen, Jiaqi Song, Yunshi Lan, Yan Wang

机构 * East China Normal University(东华师范大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 为解决现有基准仅关注情感识别而缺乏深层认知推理的问题,提出大规模层次化视觉问答数据集InsightVQA,包含725K问答对,并构建评估基准InsightVQA-Bench和基线模型InsightNet。

Comments 16 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14065 2026-06-02 cs.AI 79%

REAL: Resolving Knowledge Conflicts in Knowledge-Intensive Visual Question Answering via Reasoning-Pivot Alignment

REAL: 通过推理枢轴对齐解决知识密集型视觉问答中的知识冲突

Kai Ye, Xianwei Mao, Sheng Zhou, Zirui Shao, Ye Mo, Liangliang Liu, Haikuan Huang, Bin Li, Jiajun Bu

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

AI总结 提出REAL框架,通过推理枢轴对齐和引导解码,解决知识密集型视觉问答中因开放域检索引起的知识冲突问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23068 2026-05-25 cs.CV 79%

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering

RoboSurg-VQA:面向手术分割感知的视觉问答多模态基准

Chengyi Zhang, Zi Ye, Ziyang Wang

机构 * Swansea University, UK(威尔士大学) Maynooth University, Ireland(迈诺特大学) Aston University, UK(阿斯顿大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 提出RoboSurg-VQA基准,通过重新利用公共手术分割数据集,构建分割感知的视觉问答任务,以评估在机器人辅助和微创手术中恶劣视觉条件下的语言化临床问题理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22035 2026-05-22 cs.CV cs.CL 79%

HyLoVQA: Dynamic Hypernetwork-Generated Low-Rank Adaptation for Continual Visual Question Answering

HyLoVQA: 动态超网络生成低秩适应用于连续视觉问答

Yiran Wang, Chenyi Xiong, Ziyue Qin, Miao Zhang, Kui Xiao, Zhifei Li

机构 * School of Computer Science, Hubei University, Wuhan 430062, China(湖北大学计算机学院,武汉430062,中国) Hubei Key Laboratory of Big Data Intelligent Analysis and Application (Hubei University), Wuhan 430062, China(湖北省大数据智能分析与应用重点实验室(湖北大学),武汉430062,中国) Key Laboratory of Intelligent Sensing System and Security (Hubei University), Ministry of Education, Wuhan 430062, China(智能感知系统与安全重点实验室(湖北大学),教育部,武汉430062,中国)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 HyLoVQA通过动态超网络生成低秩适应,解决连续视觉问答中任务干扰问题,提升模型对当前任务和对象的适应能力。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13831 2026-05-14 cs.CV 79%

Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

通过超越128K上下文的泛化有效训练长上下文视觉-语言模型

Zhaowei Wang, Lishu Luo, Haodong Duan, Weiwei Liu, Sijin Wu, Ji Luo, Shen Yan, Shuai Peng, Sihang Yuan, Chaoyi Huang, Yi Lin, Yangqiu Song

机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了长上下文视觉-语言模型的持续预训练,通过平衡数据和检索优化,提出MMProLong模型在长文档VQA等任务中表现优异,且能扩展至更长上下文和多任务场景。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07574 2026-05-12 cs.CV 79%

PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models

PolarVLM:弥合视觉语言模型中的语义-物理差距

Yuliang Li, Chu Zhou, Heng Guo, Boxin Shi, Imari Sato, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) National Institute of Informatics, Japan(日本国立信息机构) Peking University, China(北京大学) The University of Tokyo, Japan(东京大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 PolarVLM通过引入极化物理参数,解决视觉语言模型在反射和透明物体等光学模糊问题中的局限,提出双流架构和分阶段训练策略,构建首个极化感知的VQA基准,实现25.4%的总体提升。

Comments 23 pages, 12 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28039 2026-05-01 cs.AI 79%

SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images

SpecVQA:一种用于科学图像光谱理解和视觉问答的基准测试

Jialu Shen, Han Lyu, Suyang Zhong, Hanzheng Li, Haoyi Tao, Nan Wang, Changhong Chen, Xi Fang

机构 * DP Technology(DP技术)

专题命中 视觉问答 :visual question answering(title);multimodal large language model(abstract);分类 cs.AI

AI总结 SpecVQA通过7种典型光谱类型和专家标注的问答对,评估多模态模型在科学光谱理解中的能力,提出光谱数据采样与插值重建方法,提升模型在科学光谱理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27759 2026-04-20 cs.CV 79%

When Surfaces Lie: Exploiting Wrinkle-Induced Attention Shift to Attack Vision-Language Models

当表面欺骗:利用褶皱诱导的注意力转移攻击视觉-语言模型

Chengyin Hu, Xuemeng Sun, Jiaju Han, Qike Zhang, Xiang Chen, Xin Wang, Yiwei Wei, Jiahua Long

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV

AI总结 本文提出一种参数化结构扰动方法,通过构建多尺度褶皱场和整合位移场扭曲与表面一致的外观变化,以攻击视觉-语言模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10695 2026-04-15 cs.CV 79%

Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification

检索以恢复:通过语义一致的净化实现不完整音频-视觉问答

Jiayu Zhang, Shuo Ye, Qilang Ye, Zihan Song, Jiajian Huang, Zitong Yu

机构 * School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Nankai University(南开大学计算机学院) School of mathematics, Sun Yat-sen University(中山大学数学学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出R$^{2}$ScP框架,通过检索而非生成方法处理缺失模态,利用统一语义嵌入进行跨模态检索,并引入上下文感知适应净化机制,提升语义恢复能力,实验表明其在不完整模态场景中性能更优。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18073 2026-04-14 cs.CV 79%

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);分类 cs.CV

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00601 2026-04-02 cs.CV 79%

KG-CMI: Knowledge graph enhanced cross-Mamba interaction for medical visual question answering

KG-CMI: 基于知识图谱的跨Mamba交互用于医学视觉问答

Xianyao Zheng, Hong Yu, Hui Cui, Changming Sun, Xiangyu Li, Ran Su, Leyi Wei, Jia Zhou, Junbo Wang, Qiangguo Jin

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) Tianjin Central Hospital of Gynecology Obstetrics(天津市中心妇产科医院) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Software, Tianjin University(天津大学计算机软件学院) Centre for Artificial Intelligence driven Drug Discovery, Faculty of Applied Science, Macao Polytechnic University(澳门理工大学应用科学学院人工智能驱动药物发现中心) Department of Cardiology, Tianjin Chest Hospital(天津市胸科医院心内科)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出KG-CMI框架,通过整合医学知识图谱提升医学视觉问答的准确性与多样性,实验表明其在三个数据集上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02703 2026-03-27 cs.CV 79%

Structure Causal Models and LLMs Integration in Medical Visual Question Answering

结构因果模型与大语言模型在医学视觉问答中的整合

Zibo Xu, Qiang Li, Weizhi Nie, Weijie Wang, Anan Liu

机构 * School of Microelectronics, Tianjin University(天津大学微电子学院) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出一种因果推理框架,通过消除图像与问题间的混杂效应,提升医学视觉问答的准确性,并引入因果图结构和多变量重采样方法以增强模型对复杂医疗数据的理解能力。

Comments Accepted by IEEE TMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24484 2026-03-26 cs.CV 79%

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 视觉问答 :multimodal large language model(title);MLLM(abstract);分类 cs.CV

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19098 2026-03-20 cs.CV 79%

TAU-R1: Visual Language Model for Traffic Anomaly Understanding

TAU-R1:用于交通异常理解的视觉语言模型

Yuqiang Lin, Kehua Chen, Sam Lockyer, Arjun Yadav, Mingxuan Sui, Shucheng Zhang, Yan Shi, Bingzhang Wang, Yuang Zhang, Markus Zarbock, Florain Stanek, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学) City of Carmel, Indiana(印第安纳州卡迈尔市) Starwit GmbH

专题命中 视觉问答 :visual language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出TAU-R1模型,通过两层框架提升交通异常识别与推理能力,结合定制化训练策略与数据集,实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16292 2026-03-19 cs.CL cs.AI 79%

Attention-guided Evidence Grounding for Spoken Question Answering

基于注意力的证据 grounding 用于语音问答

Ke Yang, Bolin Chen, Yuejie Li, Yueying Hua, Jianhao Nie, Yueping He, Bowen Li, Chengjun Mao

专题命中 视觉问答 :grounding(title,abstract);分类 cs.AI

AI总结 本文提出基于注意力的证据 grounding 方法,通过 SpeechLLM 的内部跨模态注意力机制定位关键证据,减少幻觉并提升效率,优于传统 cascaded 系统。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14769 2026-03-17 cs.CV cs.CL 79%

Frame Sampling Strategies Matter: A Benchmark for small vision language models

帧采样策略至关重要:小视觉语言模型的基准测试

Marija Brkic, Anas Filali Razzouki, Yannis Tevissen, Khalil Guetari, Mounim A. El Yacoubi

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV

AI总结 本文提出首个小规模视频视觉语言模型的帧准确基准测试,揭示了不同帧采样策略对模型性能的影响,强调了标准化采样策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09155 2026-03-11 cs.CL cs.AI 79%

OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering

OPENXRD:一个全面的基准框架用于LLM/MLLM XRD问答

Ali Vosoughi, Ayoub Shahnazari, Yufeng Xi, Zeliang Zhang, Griffin Hess, Chenliang Xu, Niaz Abdolrahim

专题命中 视觉问答 :MLLM(title);LLaVA(abstract);分类 cs.AI

AI总结 OPENXRD是一个用于评估LLM和MLLM在晶体学问答中性能的综合基准框架,通过专家审核材料验证内容质量对模型性能的关键影响。

Comments Accepted at Digital Discovery (Royal Society of Chemistry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19821 2026-03-10 cs.CV 79%

Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering

基于查询引导的时空频交互的音乐音频视觉问答

Kun Li, Michael Ying Yang, Sami Sebastian Brandt

机构 * University of Twente(特文特大学) University of Bath(巴斯大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出一种查询引导的时空频交互方法,通过整合问题引导的线索和频域特性,提升音频-视觉问答的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05143 2026-03-10 cs.CV cs.CL 79%

A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering

一种用于可解释作物疾病视觉问答的双阶段多任务视觉-语言框架

Md. Zahid Hossain, Most. Sharmin Sultana Samu, Md. Rakibul Islam, Md. Siam Ansary

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出了一种轻量且可解释的双阶段多任务视觉-语言框架,用于作物疾病视觉问答,实现了高准确率和良好的可解释性。

Comments Preprint, manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13139 2026-03-04 cs.CV cs.CL 79%

Multimodal Integration of Human-Like Attention in Visual Question Answering

多模态人类样注意机制在视觉问答中的整合

Ekta Sood, Fabian Kögel, Philipp Müller, Dominike Thomas, Mihai Bace, Andreas Bulling

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 MULAN通过整合文本和图像显著性模型的注意预测,提升了VQA模型的性能,同时减少参数数量,达到新的准确率水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13116 2026-03-04 cs.CV cs.CL 79%

VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering

VQA-MHUG:一个用于研究视觉问答中多模态神经注意机制的注视数据集

Ekta Sood, Fabian Kögel, Florian Strohm, Prajit Dhar, Andreas Bulling

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 VQA-MHUG数据集用于研究视觉问答中多模态神经注意机制,发现文本注意与模型性能的相关性是提升VQA性能的关键因素。

Comments CoNLL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00925 2026-03-03 cs.CL cs.CV cs.CY 79%

The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors

DrawEduMath之后的后果:视觉语言模型在挣扎学生面前表现不佳且误判错误

Li Lucy, Albert Zhang, Nathan Anderson, Ryan Knight, Kyle Lo

机构 * University of Washington(华盛顿大学) Insource Services(Insource服务) Worcester Polytechnic Institute(沃斯特理工学院) Allen Institute for AI(人工智能联合研究所)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文研究了视觉语言模型在处理学生数学错误识别任务中的表现,发现其在挣扎学生面前表现不佳,需改进以支持教育应用。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00595 2026-03-03 cs.CV 79%

UNICBench: UNIfied Counting Benchmark for MLLM

UNICBench: 多模态多层级计数基准与评估工具包

Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao

机构 * Northwestern Polytechnical University(北华大学) Hong Kong University of Science and Technology(香港科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Sun Yat-sen University(中山大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视觉问答 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 UNICBench是一个统一的多模态计数基准,通过准确的地面真实值和分层报告,评估45种最先进的MLLMs在图像、文本和音频计数任务上的性能,揭示了模型在推理和难分支上的不足。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00165 2026-03-03 cs.CV 79%

ConFoThinking: Consolidated Focused Attention Driven Thinking for Visual Question Answering

ConFoThinking:基于整合聚焦注意力的视觉问答思考

Zhaodong Wu, Haochen Xue, Qi Cao, Wenqi Mo, Yu Pei, Wenqi Xu, Jionglong Su, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究所) School of AI and Advanced Computing, Xi'an Jiaotong-Liverpool University, Suzhou, China(西安交通大学利物浦大学人工智能与高级计算学院)

专题命中 视觉问答 :visual question answering(title);grounding(abstract);分类 cs.CV

AI总结 ConFoThinking 通过整合聚焦注意力机制,提升大语言模型在视觉问答中的感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏