Analyzing the Behavior of Visual Question Answering Models
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments 13 pages, 20 figures; To appear in EMNLP 2016
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments 13 pages, 20 figures; To appear in EMNLP 2016
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments AI Magazine, 2016
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments Visual Question Answering, Rank VQA, Faster R-CNN, BERT, Multimodal Fusion, Ranking Learning, Hybrid Training Strategy
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments Accepted in Visual Question Answering and Dialog Workshop, CVPR 2019
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments Visual Question Answering Project
多种方言,多种语言,一种文化视角:评估多语言视觉语言模型对孟加拉文化的理解,涵盖历史关联语言和地区方言
机构 * United International University(国际联合大学) ; BRAC University(布拉塔克大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);visual question answering(abstract);grounding(abstract)
AI总结 提出 BanglaVerse 基准,通过手工标注图像和扩展至多种语言及方言,评估多语言视觉语言模型在孟加拉文化理解中的表现,发现标准孟加拉语评估高估模型能力,方言变化导致性能下降,文化知识缺失是主要瓶颈。
Comments Accepted at EMNLP 2026 (Findings)
EVADE:带弃权机制的证据验证智能诊断方法
机构 * Monash University(莫纳什大学) ; Murdoch University(默多克大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 该研究针对医学VLMs不可靠问题,提出无需训练的EVADE方法,通过跨图像视图验证一致性并引入弃权机制,在多医学VQA数据集上提升了校准度与选择性风险,同时维持了准确率。
视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐
机构 * Singapore Institute of Technology(新加坡科技学院) ; NVIDIA(英伟达)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)
AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。
Comments Accepted at ACM Multimedia 2026
mR²AG:用于基于知识的视觉问答的多模态检索-反思增强生成
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) ; Tencent Inc.(腾讯公司) ; Huawei Noah’s Ark Laboratory(华为诺亚方舟实验室)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型在基于知识的视觉问答中的缺陷,提出mR²AG框架,通过两种反思操作实现自适应检索与信息定位,在相关基准任务上性能优于现有方法。
Comments Accepted for publication in IEEE Transactions on Multimedia (TMM)
锚定、覆盖与优化:面向长视频问答的以证据为中心的帧选择框架
专题命中 视觉问答 :VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV
AI总结 本文针对长视频问答中视觉预算有限及证据对齐弱的问题,提出无需训练的GCR框架,通过锚定、覆盖、优化三步选择帧,在LongVideoBench等基准上较基线取得显著性能提升。
XSPA:构建不可察觉的X形稀疏对抗扰动以对视觉语言模型的可迁移攻击
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本文提出XSPA攻击,通过限制扰动为两条相交对角线,测试VLMs在稀疏扰动下的鲁棒性,实验表明其能显著破坏跨任务语义。
LoMeVQA:纵向医学视觉问答综合基准
机构 * Tongji University(同济大学) ; East China Normal University(华东师范大学)
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。
Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA
SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解
机构 * The University of Queensland(昆士兰大学) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) ; University of Technology Sydney(悉尼科技大学) ; Follow Me AI Pty LTD(Follow Me AI有限公司)
专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。
Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $
刻意设计的不适定问题:探究VLMs中的证据使用
机构 * Tel Aviv University(特拉维夫大学) ; IBM Research(IBM研究院)
专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出单目物体尺寸估计作为不适定诊断任务,通过反事实分析分解六种视觉和语言证据通道,评估12个开源VLM,发现最大模型仍落后于纯文本LLM,且模型未有效利用场景几何信息。
视觉语言模型像工程师一样推理吗?一个基准测试与分阶段评估
机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.AI
AI总结 提出工程视觉问答基准EngVQA和8阶段自动评估框架,揭示当前视觉语言模型在工程推理中的显著局限,并验证了自动化评估与人工评分的高度一致性。
Comments 9 pages (main text), 4 figures, 2 tables; 50 pages total including appendix. The first two authors contributed equally
答案从何而来?面向自动驾驶的多视角MLLMs中视角级视觉证据识别基准
机构 * University of Waterloo(滑铁卢大学)
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 针对多视角自动驾驶场景,提出一个基准测试,评估多模态大模型在视觉问答中识别支持性相机视角的能力,包含122个冲突中心问题对,并区分视角选择与答案正确性。
面向可靠胎儿超声解读的多智能体协作
机构 * Tsinghua University(清华大学) ; University of California San Diego(加州大学圣地亚哥分校) ; West China Second University Hospital, Sichuan University(四川大学西昌医学院)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract_cn)
AI总结 提出FetUSAgents多智能体系统,通过协作LLM代理和双路径证据仲裁(DPEA)整合视觉工具与临床推理,在胎儿超声VQA、报告生成等任务上超越最强基线25%以上。
RoiMAM:面向高效视觉-语言理解的感兴趣区域医学注意模型
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院) ; CyPhi( ) AI Research Lab, School of IT, Monash University, Malaysia Campus(CyPhi人工智能研究实验室,信息学院,墨尔本大学马来西亚校区)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本文提出RoiMAM,通过整合无训练ROI生成模块和语义选择性抑制,专注于病变相关区域,提升医疗视觉问答的效率与准确性。
Comments under revision
验证幻象:映射医学视觉问答中自我验证的可靠性边界
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Redmin University of China(红矿大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本文研究了医学视觉问答中自我验证的可靠性边界,通过分解验证行为中的辨别能力和同意偏差,发现验证幻象现象,指出任务条件对可靠性有显著影响,且验证无法独立提供安全信号。
Comments 31 pages, 12 figures
HOME-KGQA:一个多模态知识图谱问答基准数据集用于家庭日常活动
机构 * National Institute of Advanced Industrial Science(国家工业科学与技术研究院)
专题命中 视觉问答 :grounding(summary_cn,abstract);分类 cs.AI
AI总结 本文提出HOME-KGQA基准数据集,用于多模态知识图谱问答,包含多跳自然语言问题和图数据库查询语言,挑战多级时空推理和多模态 grounding。实验表明基于LLM的KGQA方法在该数据集上表现不佳,凸显实际部署中KGQA系统的挑战。
Comments 12 pages, 4 figures, 7 tables, accepted at LREC2026
迈向年龄相关性黄斑变性的多模态对话式人工智能
专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出OcularChat,一种基于多模态大语言模型的系统,通过模拟患者与医生对话,利用视网膜彩色照相进行黄斑变性诊断,展现出优于现有模型的分类性能和临床解释能力。
Comments 38 pages, 4 figures
头感知视觉裁剪:通过注意力引导的子图像增强细粒度VQA
机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)
AI总结 通过注意力引导的子图像增强细粒度VQA,提出无需训练的HAVC方法,利用优化的注意力头提升视觉定位精度。
Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)
Comments Accepted by AAAI 2026
机构 * Stony Brook University(石溪大学)
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)
机构 * ETH Zürich(苏黎世联邦理工学院) ; Google DeepMind(谷歌DeepMind) ; EPFL(瑞士联邦理工学院)
专题命中 视觉问答 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);grounding(abstract)
Comments Our code (https://github.com/CHIzhP/Chimera) and data (https://huggingface.co/datasets/CHIzhP/Chimera) are publicly available
专题命中 视觉问答 :VLM(abstract,comments);LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published at ICML 2024. 22 pages, 11 figures. Training code and models: https://github.com/TRI-ML/prismatic-vlms. Evaluation code: https://github.com/TRI-ML/vlm-evaluation
StateSight:评测视觉语言模型中的潜在空间状态重建能力
机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰斐逊科学技术高中)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究推出StateSight基准及配套数据集StateSight-Steps,评估视觉语言模型的潜在空间状态重建能力,发现GPT-5.5、Claude Sonnet 5的表现均逊于人类基线,格式正确的响应可能掩盖空间结构恢复失败的问题。
诊断大视觉语言模型中的密集同类属性绑定错误
机构 * Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) ; China Telecom Digital Intelligence Technology Co., Ltd.(中国电信数字智能科技有限公司) ; Shenyang Aerospace University(沈阳航空航天大学) ; University of Nottingham Ningbo China(宁波诺丁汉大学)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究提出InstaBind-Lite基准,量化大视觉语言模型的密集同类属性绑定错误(DSCAM),发现其错误率被总准确率掩盖,多数转移来自相邻实例,该基准可评估模型对属性所属实例的认知。
用于医学视觉问答的频域双分支融合
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
AI总结 提出频域双分支融合模块,结合BiomedCLIP与BioBART,在PMC-VQA预训练后于VQA-RAD、SLAKE微调,提升医学VQA性能且架构轻量高效。
Comments 7 Pages, 4 figures, under review at AAAI 27