What Large Language Models Bring to Text-rich VQA?
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Preprint
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 15 pages, 3 figures. Project released at: https://github.com/TencentARC/GVT
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments ACM TOMM 2021
时间基准分数衡量的是什么?分解视频视觉语言模型评估中的通道使用情况
机构 * Microsoft(微软) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉问答 :VLM(title);分类 cs.CV、cs.LG
AI总结 研究视频视觉语言模型评估中时间基准分数衡量问题,提出无标签筛选方法“反转下降”区分模型通道使用情况,如Molmo2和Qwen3-VL,指出综合分数不能反映潜在失败模式,此区分在多基准和任务中成立。
Comments 9 pages, 11 pages supplemental
面向位置的预训练方法用于医学差异视觉问答
机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University, Kigali, Rwanda(电气与计算机工程系,卡内基梅隆大学,刚果(金)基利齐) ; University of Melbourne, Melbourne, Australia(墨尔本大学,墨尔本,澳大利亚)
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
AI总结 本文提出一种面向位置的预训练框架,结合AREF、GCAP和CAREF任务,提升医学差异VQA中细粒度空间视觉表征能力,实现胸部X光图像中临床相关变化的准确识别与推理。
Comments 11 pages
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Imperial College London(帝国理工学院伦敦分校) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 视觉问答 :multimodal large language model(title);分类 cs.CV、cs.AI
Comments Early accepted by MICCAI2025
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :vision-language model(title);分类 cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments Accepted to ICLR 2024 Tiny Papers(Notable)
专题命中 视觉问答 :vision-language model(title);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.LG
Comments To appear in The Fourth Annual West Coast NLP (WeCNLP) Summit
专题命中 视觉问答 :multimodal large language model(title);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments To appear in: Proc. of the Future Technologies Conference (FTC) 2023, Nov. 2-3, San Francisco, pub. by Springer Nature
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments IEEE Transactions on Pattern Analysis and Machine Intelligence, TPAMI 2023. (Extension of CVPR'20 work). arXiv admin note: text overlap with arXiv:2003.06576
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments Accepted to ECCV 2022; Codes: https://github.com/ItemZheng/KDDAug
专题命中 视觉问答 :grounding(title);分类 cs.CV、cs.AI
Comments ACL 2020 camera-ready (15 pages)
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments 28 pages, 15 figures
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments Improved version, it also has a final table from the VQA challenge, and more baselines on DAQUAR
DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试
专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract)
AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。
看一次就够了?用于3D问答的在线几何感知令牌剪枝
机构 * National Tsing Hua University(国立清华大学) ; Industrial Technology Research Institute ITRI(工业技术研究院) ; University of Toronto(多伦多大学) ; Atmanity Inc(Atmanity公司)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 针对3D问答中多模态大语言模型推理成本高的问题,提出在线令牌剪枝方法,利用深度和相机姿态投影到体素空间,识别重叠区域并剪枝冗余令牌,减少令牌使用,提升效率和性能。
Comments published at ICLR 2026 Workshop on Efficient Spatial Reasoning
V2T-CoT:从视觉到文本链式推理用于医学推理与诊断
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 本文提出V2T-CoT方法,通过自动化定位生物医学图像中的偏好区域并将其整合到区域级像素注意力中,提升医学诊断的可解释性与准确性。
Comments 12 pages, 4 figures
视觉运动策略中的记忆检索用于长期机器人控制
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 提出HALO策略,通过注意力记忆检索机制和视觉语言模型先验蒸馏,解决长期控制中的虚假相关和记忆误差累积问题,实现从长达8分钟历史中检索任务相关信息。
Comments 16 pages, 5 tables, 8 figures
grounded还是猜测?通过盲图像对比排序进行LVLM置信度估计
机构 * Michigan State University(密歇根州立大学) ; Independent AI Researcher(独立AI研究员) ; JPMorgan AI Research(摩根大通AI研究) ; Henry Ford Health(亨利福特健康)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 本文提出BICR框架,通过对比真实图像与遮蔽图像的隐藏状态,评估LVLM的置信度,实现跨模型的校准与判别性能优化。
AVA-Bench:用于视觉基础模型的原子视觉能力基准
机构 * The Ohio State University(俄亥俄州立大学) ; Adobe Research(Adobe研究院) ; Boston University(波士顿大学)
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。
Comments Accepted by CVPR 2026. The first two authors contribute equally
VQQA:视频评估与质量提升的代理方法
机构 * Google(谷歌)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。
通过超级神经元进行类别视觉问答的捷径
机构 * Seoul National University(首尔国立大学) ; EPFL(瑞士联邦理工学院) ; Google Deepmind(谷歌DeepMind)
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出通过超级神经元提升类别视觉问答的性能,利用标量激活代替注意力向量,实现更高效的分类和更快的推理速度。
Comments 25 pages, 15 tables, 8 figures
结构感知对比学习用于多模态模型的图表理解
机构 * The Japan Research Institute, Limited(日本研究机构)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出结构感知对比学习方法,通过专门的损失函数提升多模态模型对图表图像的理解能力,在图像-文本匹配和视觉问答任务中取得显著改进。
Comments 10 pages, 8 figures
Journal ref ICCVW (2025) 7463-7472