Why context matters in VQA and Reasoning: Semantic interventions for VLM input modalities
专题命中 视觉问答 :VLM(title,abstract);visual language model(abstract);LLaVA(abstract);visual question answering(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :VLM(title,abstract);visual language model(abstract);LLaVA(abstract);visual question answering(abstract)
专题命中 视觉问答 :visual question answering(title,abstract);VLM(abstract);visual reasoning(abstract);grounding(abstract)
Comments Submitted to the Journal on February 6, 2024
CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析
机构 * New York University(纽约大学) ; McGill University(麦吉尔大学) ; Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; MIT(麻省理工学院)
专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。
Comments Accepted to ECCV 2026
用于脑肿瘤视觉指令微调的多语言模型协作式MRI报告生成
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 针对脑肿瘤缺乏配对3D成像 - 文本数据问题,提出用多语言模型协作创建3D图像 - 文本数据集,构建VLM将MRI扫描转换为令牌并与文本指令对齐,该方法在报告生成等任务中表现优于其他方法,有助于脑肿瘤诊断治疗。
关于视觉对象属性的常识推理研究
机构 * Department of Computer Science, Vrije Universiteit(自由大学计算机科学系) ; Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)
专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract)
AI总结 研究针对视觉对象属性的常识推理,引入含特定图像类型、推理层次和属性维度的评估框架,在两个VQA基准中实验,发现现有VLM存在显著局限,虽新模型有进步但仍与人类有差距,还提供了相关数据和代码以助未来研究。
SIEVES:通过视觉证据评分实现选择性预测
机构 * TU Darmstadt(图宾根大学)
专题命中 视觉问答 :grounding(summary_cn,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 SIEVES通过视觉证据评分提升视觉问答在分布外任务中的覆盖范围,相比非 grounding 基准线提升三倍,适用于多种推理模型,无需依赖模型权重或 logit。
层次驾驶视觉问答中的跨阶段一致性:显式基线与学习门控上下文投影
机构 * Technische Hochschule Augsburg(亚琛工业大学)
专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文研究了驾驶场景中跨阶段上下文传递的两种方法,显式基线通过无额外训练的4B VLM减少矛盾,隐式基线通过门控投影提升规划阶段语义一致性,两者共同探讨了领域适应在全谱改进中的潜力。
Comments 16 pages, 8 figures, 8 tables, preprint
视觉-语言模型缺少什么?探究它们在因果顺序推理中的困难
机构 * University of Southern California(南加州大学) ; University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Texas A&M University(德克萨斯A&M大学)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn)
AI总结 针对VLM在因果推理中的不足,提出VQA-Causal和VCR-Causal基准,发现模型在因果任务上仅略优于随机猜测,归因于训练数据缺乏因果表达,并通过难负例微调改善。
Comments 13 pages
AnatomiX:一种解剖学感知的胸部X光解读多模态大语言模型
机构 * Hasso Plattner Institute(霍普夫纳研究所) ; MBZUAI(穆萨大学人工智能研究所)
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出AnatomiX,一种两阶段解剖学感知多模态大语言模型,通过先识别解剖结构再执行下游任务,在解剖定位、短语定位、定位诊断和定位描述任务上相比现有方法提升超过25%。
AdaptVision: 通过自适应视觉获取实现高效的视觉-语言模型
机构 * Tencent Hunyuan(腾讯文言)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 AdaptVision通过自适应视觉获取机制,结合强化学习与工具学习,提升视觉-语言模型在视觉问答任务中的效率与准确性。
Comments Accepted by CVPR 2026. Code and models are available at https://github.com/AdaptVision/AdaptVision
RECODE: 通过代码生成进行视觉问答的推理
专题命中 视觉问答 :visual question answering(title);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 RECODE通过代码生成实现视觉问答的可验证推理,优于传统方法。
Comments The authors are withdrawing this manuscript temporarily to conduct additional checks of the experimental setup and implementation. We plan to post an updated version after completing these checks
理解视觉语言模型的细粒度知识能力
机构 * Stanford University(斯坦福大学)
专题命中 视觉问答 :vision-language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。
看见无线电:从零RF先验到可解释的调制识别与视觉语言模型
专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)
AI总结 本文提出利用视觉语言模型直接感知无线电波信号并推断调制模式,通过转换IQ流为图像数据,提升模型准确性至90%,并实现可解释的调制识别。
SPoRC-VIST:评估视觉语言模型生成自然叙述能力的基准
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 SPoRC-VIST基准通过合成到现实训练策略评估视觉语言模型生成多说话者播客对话的自然性和深度。
Comments 14 pages, 3 figures. Accepted to WVAQ 2026, WACV 2026
机构 * Dartmouth College(达特茅斯学院) ; Shandong University(山东大学) ; Harvard University(哈佛大学)
专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to EMNLP 2025 Main Conference
机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);VLM(abstract);LLaVA(abstract)
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published at ACL 2025 Findings
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学) ; MIT(麻省理工学院)
专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR 2025
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks
专题命中 视觉问答 :vision language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Proceedings of the 40th International Conference on Machine Learning (ICML), 2023
专题命中 视觉问答 :visual question answering(title,abstract);VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments 13 pages, 6 figures, a plug-and-play framework to augment large vision-language models with up-to-date internet knowledge
PlanSightRAG:面向民用标准图纸的自动化问答与合规检查的视觉优先多模态检索增强生成模型
机构 * University of Wyoming(怀俄明大学)
专题命中 视觉问答 :grounding(summary_cn,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对民用标准图纸的OCR自动化方法会丢失关键几何信息,本文提出视觉优先多模态RAG框架PlanSightRAG,整合多向量检索与智能体架构,构建基准数据集并验证其在检索、合规检查任务上的性能,还实现了自主视觉规则 grounding。
Comments 32 pages, 9 figures, 25 tables. Preprint submitted to Automation in Construction
先总结,后下载:面向带宽高效的地球观测的机载视觉语言模型
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 针对地球观测卫星下行链路带宽瓶颈,提出“先总结,后下载”范式,通过机载VLM生成摘要、地面VQA验证后按需下载全分辨率图像,可降带宽消耗并加速时间敏感任务的洞察时间。
Comments IGARSS2026
基于小型视觉语言模型多任务学习的 grounded 胃肠道内窥镜视觉问答研究
机构 * Institute of Business and Administration(商业管理学院)
专题命中 视觉问答 :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract)
AI总结 该研究针对胃肠道内窥镜视觉问答任务,提出多任务微调方案,利用现有数据集构建辅助任务,微调小型视觉语言模型,实现了准确率提升与答案-图像区域对齐优化。
Comments Accepted at EMA4MICCAI 2026 (Workshop on Efficient Medical AI, MICCAI 2026)
超越场景先验:通过基准测试和查询引导的小目标聚焦进行细粒度交通场景推理
机构 * The University of Hong Kong(香港大学) ; Sun Yat-Sen University(中山大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对安全关键交通场景中复杂问题,提出细粒度交通推理基准FGTR - Bench和文本引导小目标推理MLLM(TSR - MLLM),解决视觉语言对齐中关键小目标被忽视问题,提升模型性能。
先定位再排序:基于知识的视觉问答中无训练实体识别的再探讨
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; AT&T Chief Data Office(AT&T首席数据办公室)
专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
AI总结 针对知识型视觉问答中实体与证据双重定位瓶颈,提出解耦实体识别与段落排序的无训练IBA框架,利用MLLM候选名称选择与文本重排序器,在降低复杂度同时提升性能。
Comments Accepted by ACL 2026 Findings. Project page https://github.com/VAN-QIAN/ACL26-IBA/
SAFE-Cascade: 面向图表问答的成本自适应视觉语言路由
机构 * University of Arkansas(亚拉巴马大学)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 提出SAFE-Cascade系统,通过OCR和轻量语言模型先给出答案,再由学习路由器决定是否调用VLM,在ChartQA上以73.1%的VLM调用率达到69.1%准确率,减少26.9%的VLM调用和9.3%的成本。
Comments Demo paper submitted at CIKM 2026. 4 pages, 2 figures
KG-ViP:在多模态大语言模型中桥接知识基础与视觉感知以进行视觉问答
机构 * University of Science and Technology of China(中国科学技术大学) ; Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,中国科学技术大学) ; School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
专题命中 视觉问答 :visual question answering(title,abstract);grounding(title);分类 cs.CV
AI总结 提出KG-ViP框架,通过检索与融合场景图和常识图,统一外部知识与细粒度视觉细节,缓解多模态大语言模型在视觉问答中的知识幻觉和视觉感知不足问题。