Proposing Plausible Answers for Open-ended Visual Question Answering
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments include test-standard result on VQA full release (V1.0) dataset
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments Accepted by TIP2023, The Arxiv version of "Weakly-Supervised 3D Spatial Reasoning for Text-based Visual Question Answering"
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments CVPR 2018 full oral, winner of the 2017 Visual Question Answering challenge
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments Winner of the 2017 Visual Question Answering (VQA) Challenge at CVPR
CardioLens: 通过多序列心脏MRI评估揭示MLLMs的临床现实差距
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Beijing Anzhen Hospital(北京安贞医院) ; Beihang University(北航) ; King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出CardioLens测试平台,通过多序列心脏磁共振成像评估24个多模态大语言模型,发现其在临床工作流中表现不佳,存在类别崩溃失败模式,且输入选择和推理提示改进效果有限。
NeuroQA: 一种大规模的3D脑部MRI理解图像 grounded 评估基准
机构 * Stanford University(斯坦福大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出NeuroQA,一个大规模的3D脑部MRI视觉问答基准,包含来自12977名受试者的56953个问答对,涵盖5-104岁及五个临床领域,通过3D体积评估11种临床推理技能,并提供可复现的生成脚本和在线排行榜。
Comments 30 pages, dataset and benchmark release
OpenLifelogQA:一个开放式多模态生活日志问答数据集
专题命中 视觉问答 :LLaVA(summary_cn,abstract)
AI总结 OpenLifelogQA数据集包含14187对问答对,用于支持真实场景下的鲁棒评估,相比现有资源更适用于实际应用,通过评估LLaVA-NeXT-Interleave 7B模型展示了其在生活日志问答中的性能。
Comments In the proceedings of the 14th International Symposium on Information and Communication Technology
重新思考多模态问答中的信息合成:多智能体视角
机构 * Arizona State University(亚利桑那州立大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);visual language model(abstract);multimodal large language model(abstract)
AI总结 本文提出多智能体框架MAMMQA,通过分解查询、跨模态推理和整合答案,提升多模态问答的准确性和可解释性。
机构 * TCS Research(塔塔咨询研究)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 17 pages, 6 figures, 5 tables. Accepted to Special Track on AI Alignment, AAAI 2026. Project Page- https://refine-align.github.io/
机构 * University of Zurich, Max Planck Society(苏黎世大学、马克斯·普朗克研究所)
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted for publication in AAAI 2025 (Main Track)
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments To appear in ACL Findings, 2024
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project page: https://janghyuncho.github.io/Cube-LLM
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments First three authors contributed equally. Code are available at https://github.com/amazon-research/mix-generation. Oral presentation at WACV 2023 Pretraining Large Vision and Multimodal Models Workshop
面向扩散多模态大语言模型的视觉信息引导并行解码
机构 * Seoul National University(首尔大学)
专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。
基于结构化上下文推理提升基于知识的视觉问答性能
机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) ; School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) ; Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 本文提出SCoRe框架,通过上下文获取、选择、压缩三阶段处理多模态知识,在OK-VQA和A-OKVQA基准上性能优于现有最优方法,提升了基于知识的视觉问答效果。
Comments Accepted by ICME 2026. Source code is available at https://github.com/WISLab-GDUT/SCoRe
QIRL:用于实现偏差鲁棒视觉问答的优化问答-图像关系学习
机构 * School of Computer Science and Engineering, Macau University of Science and Technology(澳门科技大学计算机科学与工程学院) ; Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) ; State Key Laboratory of Maritime Technology and Safety, Wuhan University of Technology(武汉理工大学) ; School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) ; Macau University of Science and Technology Zhuhai MUST Science and Technology Research Institute(澳门科技大学珠海澳科大科技研究院)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 该研究针对现有VQA偏差缓解方法的两大局限,提出QIRL框架,通过NIG与ISI模块结合生成驱动自监督学习,在VQA-CPv2和VQA-v2数据集上取得最优性能,可适配各类VQA架构。
SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中
机构 * University of California San Diego(加州大学圣迭戈分校) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学)
专题命中 视觉问答 :grounding(title,abstract);分类 cs.LG
AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%
Comments Haozhou Xu and Dongxia Wu are co-first authors
TemMed-Bench:评估视觉语言模型的时序医学图像推理能力
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。
多模态场景图与科莫戈罗夫-阿诺尔德专家网络用于音频-视觉问答
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China(网络与交换技术国家重点实验室,北京邮电大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI
AI总结 本文提出基于多模态场景图与科莫戈罗夫-阿诺尔德专家网络的SHRIKE模型,用于提升音频-视觉问答任务中的跨模态交互建模与时间推理性能。
UniHEAR:面向基于知识的视觉问答的统一异构源注意力检索
机构 * School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 针对KB-VQA现有系统的单源检索瓶颈与检索源盲重排序问题,提出UniHEAR框架,在E-VQA和InfoSeek数据集上实现最优检索与VQA性能,提升Recall@1达6.7和1.2个点。
Comments Accepted by ACM MM 2026
贝叶斯数据重加权改进基于知识的视觉问答的多模态检索
机构 * University at Buffalo(布法罗大学) ; NEC Laboratories America(美国 NEC 实验室) ; Adobe Research(奥多比研究院) ; Iowa State University(爱荷华州立大学) ; New York University(纽约大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.LG
AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。
HierDoc:用于长文档视觉问答的分层页到区域证据路由
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 HierDoc是分层证据路由框架,将长文档视觉问答的页与区域选择整合为连续两阶段,在开放权重系统中达SOTA,使LongDocURL提升16.87%,区域证据可显著提升单页系统性能。
Comments 15 pages, 4 figures; includes supplementary material
阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准
机构 * Turing Inc.(Turing公司) ; The University of Tokyo(东京大学) ; Institute of Science Tokyo(东京科学研究院) ; Tohoku University(东北大学)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。
Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/
超越医学诊断:医学多模态大语言模型如何在空间中思考
专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 本文提出SpatialMed基准,通过自主合成空间视觉问答数据评估医学MLLMs的3D空间智能,发现现有模型在医学影像空间推理能力不足。
AV-Master:双路径综合感知实现更优的音频视觉问答
机构 * Great Bay University(大湾区大学) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) ; Nankai University(南开大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 AV-Master通过动态建模时序和模态维度,提升模型在复杂视听场景中提取关键信息的能力,有效解决现有方法在时间采样和模态偏好意识上的不足,从而在复杂场景中增强推理能力。
Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT'26)