Multimodal Explanations: Justifying Decisions and Pointing to the Evidence
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments arXiv admin note: text overlap with arXiv:1612.04757
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments arXiv admin note: text overlap with arXiv:1612.04757
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments To be presented at AAAI-2018. Code, pre-trained models and dataset at github.com/val-iisc/sketchguess
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments Advances in Neural Information Processing Systems 30 (NIPS 2017)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments To appear on ICCV 2017
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments Corrects an error in the evaluation of the NMN-only ablation experiment
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted for SIGIR 2017
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments Presented at NIPS 2016 Workshop on Interpretable Machine Learning in Complex Systems. This is an extended abstract version of arXiv:1610.02391 (CVPR format)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments Conference on Empirical Methods in Natural Language Processing (EMNLP) 2016
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV;MLLM(comments)
Comments MLLM, 3D medical image analysis
专题命中 视觉问答 :visual question answering(abstract,comments);分类 cs.CV
Comments Presented as poster in CVPR 2021 Visual Question Answering Workshop
EgoErrorVQA:通过程序错误评估自我主体人工智能的以自我为中心的理解能力
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉问答 :visual language model(abstract);分类 cs.CV
AI总结 针对现有视觉智能体和VLMs忽略以自我为中心视角评估程序理解能力的问题,本文提出EgoErrorVQA任务,开发基于A2A协议的评估智能体,引入Ego-ADR框架提升模型对程序错误的理解,取得良好效果。
面向大型语言模型的忠实知识图谱问答的组合式关系链
机构 * Sun Yat-sen University(中山大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文针对现有基于LLM的KGQA方法存在的实体剪枝不可靠、约束处理无基础的局限,提出组合式关系链(CCoR)框架,以关系为中心探索实现更忠实的多跳KGQA,在多个基准上性能优于基线。
引用在偏好数据中的作用
机构 * University of Maryland(马里兰大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文在科学问答场景下,通过混合效应模型研究引用对人类与四个开源LLM偏好的影响,发现人类偏好多样且数量少的引用,LLM也有相关偏好,还探讨了对偏好数据收集的启示。
SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术
机构 * University of Strasbourg(斯特拉斯堡大学) ; CNRS(法国国家科学研究中心) ; INSERM(法国国家健康与医学研究院) ; ICube, UMR7357(ICube实验室,UMR7357)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。
Comments 29 pages, 14 figures, 9 tables
仅掩码不足:面向医疗AI的多模态去标识化生成式修复
机构 * Kennesaw State University(肯尼索州立大学) ; Miami University(迈阿密大学) ; Georgia State University(佐治亚州立大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 针对医疗图像-文本数据的PHI泄漏问题,提出端到端多模态净化框架ClinX,结合图像侧生成式修复与文本侧渐进式去标识化,在MedVQA中验证其优于仅OCR掩码的性能。
面向基于视觉-语言-动作(VLA)的端到端自动驾驶的协同多模态交互
机构 * National University of Singapore (NUS)(新加坡国立大学) ; Hunan University(湖南大学) ; The University of Western Australia (UWA)(西澳大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本文针对现有VLA自动驾驶模型决策不可靠、多模态交互不足的问题,提出含三类核心组件的多模态交互与多轨迹规划系统,实验显示其在安全推理与场景感知上优于现有系统。
通过高效的段级到视频级监督增强长视频理解的局部推理能力
机构 * Ant Group(蚂蚁集团)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。
CogCanvas: 用于评估多主体参考图像生成的基准
机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) ; University of Dayton, Ohio, United States(代顿大学) ; Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 提出CogCanvas基准,包含1952张参考图像和1361个组合提示,评估多身份、对象绑定和背景场景的生成,引入BG-Sim和Attr-VQA指标,发现现有模型在超过3个主体时性能严重下降。
ArmorOCR:基于观测迁移自蒸馏的 grounded 对抗性视觉感知
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本文提出ArmorOCR两阶段训练框架,结合OPSD与GRPO,推出含390幅图像的AdvSpot基准,可提升对抗性OCR感知能力并保留通用OCR性能
评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。
DeepWeaver:弥合开放域问答中的证据合成鸿沟
机构 * Tsinghua University(清华大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 该研究针对开放域问答中检索与生成间的证据合成鸿沟,提出DeepWeaver框架,通过Thought Block Chains编织证据,在LoQA和DeepResearch Bench基准上提升了问答的内容、引用及见解质量。
Comments 49 pages, 6 figures
回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉
机构 * Xidian University(西安电子科技大学) ; Tsinghua University(清华大学) ; Shanghai Road Transport Development Center(上海市道路运输发展中心) ; Hunan Institute of Advanced Technology(湖南先进技术研究院)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。
Comments Accepted by ACM Multimedia 2026
你所问即你所定位:连接问题意图与时序证据以实现定位视频问答
机构 * KAIST(韩国科学技术院) ; Ewha Womans University(梨花女子大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 针对定位视频问答中问题不变定位的失效模式,提出GroundFormer模型,通过可学习通信令牌、因子化MIL交叉注意力等技术,在NExT-GQA和STAR数据集上实现最优性能,提升时序定位的问题区分性。
Comments Accepted at ECCV2026. Code: https://github.com/jinhseo/GroundFormer. Project page: https://jinhseo.github.io/groundformer/groundformer.html