Curriculum Script Distillation for Multilingual Visual Question Answering
专题命中 视觉问答 :visual question answering(title,abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(title,abstract)
专题命中 视觉问答 :visual question answering(title,abstract)
Comments Accepted to appear at the main conference of EMNLP 2022
专题命中 视觉问答 :grounding(title,abstract)
Comments Accepted as Main Conference Long paper at COLING 2022
专题命中 视觉问答 :grounding(title,abstract)
Comments MM22
专题命中 视觉问答 :visual question answering(title,abstract)
Comments Findings of ACL 2022
专题命中 视觉问答 :visual question answering(title,abstract)
Comments Accepted in EMNLP-Findings (2021)
专题命中 视觉问答 :visual question answering(title,abstract)
Comments Accepted to SIGIR'21 as a short paper
专题命中 视觉问答 :visual question answering(title,abstract)
Comments ICMR '21: ACM International Conference on Multimedia Retrieval, Taipei, Taiwan, August 21-24, 2021
专题命中 视觉问答 :visual question answering(title,abstract)
Comments ACL 2019 (7 pages)
专题命中 视觉问答 :visual question answering(title,abstract)
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI、cs.LG
Comments Working notes from the ImageCLEF 2019 VQA-Med competition
用于医学视觉语言模型无注释幻觉缓解的反事实解剖学引导时空解码
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; MedOS
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
AI总结 该研究提出无需人工注释的CAST框架,通过自动选择解剖区域结合对比解码,在SLAKE和MIMIC-CXR数据集上针对三种Med-VLMs实现优于基线的幻觉缓解,提升了医学视觉语言模型的空间接地性。
Comments Accepted by MICCAI 2026
重排序器所见:面向长文档多模态问答的多方面页面标注
机构 * Emory University(埃默里大学) ; Hippocratic AI(希波克拉底人工智能公司)
专题命中 视觉问答 :VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI
AI总结 本文针对长文档多模态问答的重排序瓶颈,提出含Trident-R与Trident-S组件的Trident模型,通过多方面页面标注提升检索与生成性能,在多数据集上取得显著效果。
VideoVIBE:用于一次性交互式网站生成的基于视频的诊断基准
专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);分类 cs.CV
AI总结 针对现有一次性交互式网站生成质量评估的不足,提出VideoVIBE基准与V2Lens多智能体系统,实验显示V2Lens可提升Video MLLM的评估性能。
ChronoVision:基于潜在状态重构的时序推理
专题命中 视觉问答 :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。
DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。
OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI
AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。
面向医学视觉基础模型的位置感知细粒度表示学习
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(矢量研究所)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
AI总结 本研究提出基于位置感知细粒度表示学习的医学视觉基础模型LoFi,构建大规模医学定位数据集MedG,在多项医学视觉任务中性能优于现有模型。
ViewMind3D:用于无需训练的3D问答的模块化视图感知推理
专题命中 视觉问答 :grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。
LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The University of Hong Kong(香港大学) ; Tsinghua University(清华大学) ; University of Sussex(萨塞克斯大学)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract_cn);分类 cs.LG
AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。
迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架
机构 * East China Normal University(华东师范大学) ; Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) ; Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司) ; Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 研究针对染色转移建模难题,提出DMCoStain框架,通过迭代优化数据与模型能力提升准确性和可解释性。基于IPE视觉语言模型构建MEGFS策略并创建ImmunoInstruction数据集,实验证明该框架达最优精度,其范式有实用价值,MEGFS可作评估工具。
Comments 10 pages, accepted by ACMMM2026 Main Track
AIM-CoT:基于主动信息的多模态链式推理用于视觉-语言推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本文提出AIM-CoT框架,通过上下文增强注意力图生成、主动视觉探测和动态注意力转移触发,改进视觉语言模型的证据选择与插入触发,提升视觉-语言推理性能。
Comments Accepted by ACL 2026 Main Conference. 30 pages, 6 figures
人工智能生成的以人为中心的视频的多维质量评估:数据集与模型
机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) ; USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院) ; Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 研究针对AI生成的以人为中心的视频质量评估问题,提出扩展数据集HVEval+并构建MoE-Rater模型,该模型采用专家混合及三阶段训练策略,能统一多种任务,在相关数据集上性能优越,推动了视频质量评估及T2V模型优化。
Comments Accepted for publication in IEEE TCSVT, 2026
CaST-Bench:面向视频问答的因果链时空推理基准
机构 * Woven by Toyota(丰田公司) ; The University of Tokyo(东京大学)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV
AI总结 提出CaST-Bench基准,通过构建包含因果链时空标注的数据集和评估指标,系统评测视觉语言模型在视频因果推理中的细粒度证据定位能力。
Comments CVPR 2026
识别和解决基于知识的VQA基准测试中的陷阱:审计、修复与增强
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; AT&T Chief Data Office(AT&T首席数据办公室)
专题命中 视觉问答 :VLM(abstract_cn);visual language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本文审计现有KB-VQA基准测试,发现答案缺失/矛盾、问题不明确和视觉场景简单等系统性问题,导致准确率指标误导模型排名;提出审计-修复协议和多重实体增强协议,重新评估后性能趋势显著变化。
Comments Accepted to ECCV 2026. The datasets and code are available in https://github.com/VAN-QIAN/ECCV26-ARA
显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型
机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) ; Agency for Science, Technology and Research (A*STAR)(科技研究局) ; Singapore(新加坡)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。
Comments Accepted to ECCV 2026
X-Stream: 探索多模态大语言模型作为多流理解的多路复用器
机构 * MMLab, Chinese University of Hong Kong(中大香港人工智能实验室) ; Huawei Inc.(华为公司)
专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);分类 cs.CV
AI总结 为解决多流视频理解评估缺失的问题,提出首个基准X-Stream,包含4220个QA对和932个视频,覆盖多窗口、多视角和多设备场景,并基于信号多路复用理论评估MLLM作为多路复用器的性能,发现现有模型在并发流上仅达约50%分数。
Comments Project Page: https://peiwensun2000.github.io/xstream/
EEmo-Logic:面向全面图像诱发情感评估的统一数据集与多阶段框架
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出最大图像诱发情感理解数据集EEmoDB和统一多模态大语言模型EEmo-Logic,通过指令微调和任务定制GRPO实现细粒度情感问答与评估。
Colon-Bench:一种用于全流程结肠镜视频中可扩展密集病变标注的智能工作流
机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科学与技术大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 提出Colon-Bench,通过多阶段智能工作流实现全流程结肠镜视频的密集病变标注,包含528个视频、14类病变、30万+边界框等,并评估多模态大模型在病变分类、开放词汇视频目标分割和视频视觉问答上的性能。
Comments published at MICCAI 2026
先看再缩放:视觉RAG中分辨率-上下文权衡的自适应路由
机构 * VinUni-Illinois Smart Health Center, VinUniversity(VinUni-Illinois智慧健康中心,VinUniversity) ; Texas A&M University(德克萨斯农工大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出ViRGo框架,通过自适应路由选择全局感知、基于补丁或注意力的检索,以平衡小目标细节和大目标上下文,提升视觉RAG的精度与效率。