arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3153 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3153 篇

1802.08129 2018-02-23 cs.AI cs.CL cs.CV 62%

Multimodal Explanations: Justifying Decisions and Pointing to the Evidence

Dong Huk Park, Lisa Anne Hendricks, Zeynep Akata, Anna Rohrbach, Bernt Schiele, Trevor Darrell, Marcus Rohrbach

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: text overlap with arXiv:1612.04757

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.09356 2018-01-30 cs.CV cs.AI 62%

Game of Sketches: Deep Recurrent Models of Pictionary-style Word Guessing

Ravi Kiran Sarvadevabhatla, Shiv Surya, Trisha Mittal, Venkatesh Babu Radhakrishnan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments To be presented at AAAI-2018. Code, pre-trained models and dataset at github.com/val-iisc/sketchguess

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.00683 2017-12-20 cs.CV cs.CL cs.LG 62%

Modulating early visual processing by language

Harm de Vries, Florian Strub, Jérémie Mary, Hugo Larochelle, Olivier Pietquin, Aaron Courville

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Advances in Neural Information Processing Systems 30 (NIPS 2017)

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.01238 2017-12-05 cs.CV cs.CL cs.LG 62%

Learning by Asking Questions

Ishan Misra, Ross Girshick, Rob Fergus, Martial Hebert, Abhinav Gupta, Laurens van der Maaten

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.00717 2017-10-03 cs.CV cs.AI cs.CL 62%

It Takes Two to Tango: Towards Theory of AI's Mind

Arjun Chandrasekaran, Deshraj Yadav, Prithvijit Chattopadhyay, Viraj Prabhu, Devi Parikh

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.04686 2017-08-17 cs.CV cs.CL cs.LG 62%

VQS: Linking Segmentations to Questions and Answers for Supervised Attention in VQA and Question-Focused Semantic Segmentation

Chuang Gan, Yandong Li, Haoxiang Li, Chen Sun, Boqing Gong

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments To appear on ICCV 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.04757 2017-07-26 cs.CV cs.AI cs.CL 62%

Attentive Explanations: Justifying Decisions and Pointing to the Evidence

Dong Huk Park, Lisa Anne Hendricks, Zeynep Akata, Bernt Schiele, Trevor Darrell, Marcus Rohrbach

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.02799 2017-07-25 cs.CV cs.CL cs.LG cs.NE 62%

Neural Module Networks

Jacob Andreas, Marcus Rohrbach, Trevor Darrell, Dan Klein

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Corrects an error in the evaluation of the NMN-only ablation experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.06355 2017-07-21 cs.CV cs.AI cs.CL 62%

Video Question Answering via Attribute-Augmented Attention Network Learning

Yunan Ye, Zhou Zhao, Yimeng Li, Long Chen, Jun Xiao, Yueting Zhuang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted for SIGIR 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.04517 2017-04-18 cs.CL cs.AI cs.CV 62%

ShapeWorld - A new test methodology for multimodal language understanding

Alexander Kuhnle, Ann Copestake

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.07450 2017-01-26 stat.ML cs.CV cs.LG 62%

Grad-CAM: Why did you say that?

Ramprasaath R Selvaraju, Abhishek Das, Ramakrishna Vedantam, Michael Cogswell, Devi Parikh, Dhruv Batra

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Presented at NIPS 2016 Workshop on Interpretable Machine Learning in Complex Systems. This is an extended abstract version of arXiv:1610.02391 (CVPR format)

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.06622 2016-09-27 cs.CV cs.CL cs.LG 62%

Question Relevance in VQA: Identifying Non-Visual And False-Premise Questions

Arijit Ray, Gordon Christie, Mohit Bansal, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Conference on Empirical Methods in Natural Language Processing (EMNLP) 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.08188 2016-08-30 cs.AI cs.CL cs.CV cs.HC 62%

Visual Question: Predicting If a Crowd Will Agree on the Answer

Danna Gurari, Kristen Grauman

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.05099 2016-04-20 cs.CL cs.CV cs.LG 62%

Yin and Yang: Balancing and Answering Binary Visual Questions

Peng Zhang, Yash Goyal, Douglas Summers-Stay, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.01715 2015-12-17 cs.CV cs.AI 62%

A Restricted Visual Turing Test for Deep Scene and Event Understanding

Hang Qi, Tianfu Wu, Mun-Wai Lee, Song-Chun Zhu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00578 2024-04-02 cs.CV 61%

M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models

Fan Bai, Yuxin Du, Tiejun Huang, Max Q. -H. Meng, Bo Zhao

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV;MLLM(comments)

Comments MLLM, 3D medical image analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.06075 2021-11-12 cs.CV 61%

Graph Relation Transformer: Incorporating pairwise object features into the Transformer architecture

Michael Yang, Aditya Anantharaman, Zachary Kitowski, Derik Clive Robert

专题命中 视觉问答 :visual question answering(abstract,comments);分类 cs.CV

Comments Presented as poster in CVPR 2021 Visual Question Answering Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24134 2026-08-26 cs.CV 新提交 57%

EgoErrorVQA: Assess Egocentric Comprehension Capabilities through Procedural Errors for Ego-Agentic AI

EgoErrorVQA:通过程序错误评估自我主体人工智能的以自我为中心的理解能力

Junlong Li, Junxi Li, Jianjun Gao, Chen Cai, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :visual language model(abstract);分类 cs.CV

AI总结 针对现有视觉智能体和VLMs忽略以自我为中心视角评估程序理解能力的问题,本文提出EgoErrorVQA任务,开发基于A2A协议的评估智能体,引入Ego-ADR框架提升模型对程序错误的理解,取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22762 2026-08-25 cs.AI 新提交 57%

Compositional Chain-of-Relations for Faithful Knowledge Graph Question Answering with Large Language Models

面向大型语言模型的忠实知识图谱问答的组合式关系链

Chenhui Liu, Jianpeng Zhou, Jiahai Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文针对现有基于LLM的KGQA方法存在的实体剪枝不可靠、约束处理无基础的局限,提出组合式关系链(CCoR)框架,以关系为中心探索实现更忠实的多跳KGQA,在多个基准上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21376 2026-08-25 cs.CL cs.AI 新提交 57%

On the Role of Citations in Preference Data

引用在偏好数据中的作用

Yu Hou, Hal Daumé, Rachel Rudinger, William Walden

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文在科学问答场景下,通过混合效应模型研究引用对人类与四个开源LLM偏好的影响,发现人类偏好多样且数量少的引用,LLM也有相关偏好,还探讨了对偏好数据收集的启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-08-25 cs.CV 版本更新 57%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21133 2026-08-24 cs.CV cs.CR 新提交 57%

Masking Is Not Enough: Generative Restoration for Multimodal De-Identification in Medical AI

仅掩码不足:面向医疗AI的多模态去标识化生成式修复

Shiva Shrestha, Zongxing Xie, Chen Zhao, Liran Ma, Zhipeng Cai, Honghui Xu

机构 * Kennesaw State University(肯尼索州立大学) Miami University(迈阿密大学) Georgia State University(佐治亚州立大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 针对医疗图像-文本数据的PHI泄漏问题,提出端到端多模态净化框架ClinX,结合图像侧生成式修复与文本侧渐进式去标识化,在MedVQA中验证其优于仅OCR掩码的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20890 2026-08-24 cs.CV cs.RO 新提交 57%

A Collaborative Multi-Modality Interaction for VLA-based End-to-End Autonomous Driving

面向基于视觉-语言-动作(VLA)的端到端自动驾驶的协同多模态交互

Jingtao Sun, Xiaohai He, Yike Zhang, Dong Huang, Yaonan Wang, Ajmal Mian, Mike Zheng Shou

机构 * National University of Singapore (NUS)(新加坡国立大学) Hunan University(湖南大学) The University of Western Australia (UWA)(西澳大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文针对现有VLA自动驾驶模型决策不可靠、多模态交互不足的问题,提出含三类核心组件的多模态交互与多轨迹规划系统,实验显示其在安全推理与场景感知上优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20814 2026-08-24 cs.CV 新提交 57%

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

通过高效的段级到视频级监督增强长视频理解的局部推理能力

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren

机构 * Ant Group(蚂蚁集团)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15867 2026-08-24 cs.CV 版本更新 57%

CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation

CogCanvas: 用于评估多主体参考图像生成的基准

Long-Bao Nguyen, Quang-Khai Le, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) University of Dayton, Ohio, United States(代顿大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 提出CogCanvas基准,包含1952张参考图像和1361个组合提示,评估多身份、对象绑定和背景场景的生成,引入BG-Sim和Attr-VQA指标,发现现有模型在超过3个主体时性能严重下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20122 2026-08-21 cs.CV 新提交 57%

ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation

ArmorOCR:基于观测迁移自蒸馏的 grounded 对抗性视觉感知

Linhan Cao, Siyuan Li, Jun Lan, Liangbo He, Guannan Li, Xiaolei Huang, Jun Jia, Shuheng Zhou, Huijia Zhu, Weiqiang Wang, Wei Sun

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出ArmorOCR两阶段训练框架,结合OPSD与GRPO,推出含390幅图像的AdvSpot基准,可提升对抗性OCR感知能力并保留通用OCR性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06108 2026-08-21 cs.AI 版本更新 57%

Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents

评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准

Yuanhong Jiang, Jingjie Zou, Rui Jiang, Zhenghong Lin, Xusheng Yu, Qiqi Huang, Shuai Jia, Shijie Dai

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18988 2026-08-20 cs.CL cs.AI 新提交 57%

DeepWeaver: Bridging the Evidence Synthesis Gap in Open-Ended Question Answering

DeepWeaver:弥合开放域问答中的证据合成鸿沟

Xujia Wang, Yizhe Zhang, Bin Xu, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 该研究针对开放域问答中检索与生成间的证据合成鸿沟,提出DeepWeaver框架,通过Thought Block Chains编织证据,在LoQA和DeepResearch Bench基准上提升了问答的内容、引用及见解质量。

Comments 49 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16841 2026-08-20 cs.CV cs.MM 版本更新 57%

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Road Transport Development Center(上海市道路运输发展中心) Hunan Institute of Advanced Technology(湖南先进技术研究院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15708 2026-08-18 cs.CV 新提交 57%

What You Ask is What You Ground: Bridging Question Intent to Temporal Evidence for Grounded VideoQA

你所问即你所定位:连接问题意图与时序证据以实现定位视频问答

Jinhwan Seo, Kyubeom Han, Jumin Lee, Junhyug Noh, Sung-eui Yoon

机构 * KAIST(韩国科学技术院) Ewha Womans University(梨花女子大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 针对定位视频问答中问题不变定位的失效模式,提出GroundFormer模型,通过可学习通信令牌、因子化MIL交叉注意力等技术,在NExT-GQA和STAR数据集上实现最优性能,提升时序定位的问题区分性。

Comments Accepted at ECCV2026. Code: https://github.com/jinhseo/GroundFormer. Project page: https://jinhseo.github.io/groundformer/groundformer.html

详情

展开后加载摘要…

URL PDF HTML 收藏