arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3148 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3148 篇

2109.00590 2022-03-29 cs.CL cs.AI cs.CV cs.LG 67%

WebQA: Multihop and Multimodal QA

Yingshan Chang, Mridu Narang, Hisami Suzuki, Guihong Cao, Jianfeng Gao, Yonatan Bisk

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.08217 2021-08-19 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

X-modaler: A Versatile and High-performance Codebase for Cross-modal Analytics

Yehao Li, Yingwei Pan, Jingwen Chen, Ting Yao, Tao Mei

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by 2021 ACMMM Open Source Software Competition. Source code: https://github.com/YehLi/xmodaler

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.06383 2021-07-15 cs.CV cs.AI cs.CL cs.LG 67%

How Much Can CLIP Benefit Vision-and-Language Tasks?

Sheng Shen, Liunian Harold Li, Hao Tan, Mohit Bansal, Anna Rohrbach, Kai-Wei Chang, Zhewei Yao, Kurt Keutzer

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.02779 2021-05-25 cs.CL cs.AI cs.CV cs.LG 67%

Unifying Vision-and-Language Tasks via Text Generation

Jaemin Cho, Jie Lei, Hao Tan, Mohit Bansal

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2021 (15 pages, 4 figures, 14 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.00421 2021-05-04 cs.CV cs.AI cs.LG 67%

A survey on VQA_Datasets and Approaches

Yeyun Zou, Qiyu Xie

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.03678 2020-12-08 cs.CV cs.AI cs.CL cs.LG 67%

Generating Natural Questions from Images for Multimodal Assistants

Alkesh Patel, Akanksha Bindal, Hadas Kotek, Christopher Klein, Jason Williams

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 4 pages, 1 reference page, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.11735 2020-11-25 cs.AI cs.CV cs.LG 67%

Large Scale Multimodal Classification Using an Ensemble of Transformer Models and Co-Attention

Varnith Chordia, Vijay Kumar BG

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.01801 2020-07-23 cs.CV cs.AI cs.CL cs.LG 67%

Answering Questions about Data Visualizations using Efficient Bimodal Fusion

Kushal Kafle, Robik Shrestha, Brian Price, Scott Cohen, Christopher Kanan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Presented at WACV, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.03977 2020-07-15 cs.AI cs.CL cs.CV cs.LG 67%

Multimodal Intelligence: Representation Learning, Information Fusion, and Applications

Chao Zhang, Zichao Yang, Xiaodong He, Li Deng

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.05880 2020-03-10 cs.CV cs.AI cs.CL cs.IR cs.LG 67%

Factor Graph Attention

Idan Schwartz, Seunghak Yu, Tamir Hazan, Alexander Schwing

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to CVPR 2019; revised version includes bottom-up features

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13211 2020-02-18 cs.LG cs.AI cs.CV cs.NE stat.ML 67%

What Can Neural Networks Reason About?

Keyulu Xu, Jingling Li, Mozhi Zhang, Simon S. Du, Ken-ichi Kawarabayashi, Stefanie Jegelka

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.09551 2019-12-23 cs.CV cs.AI cs.CL cs.LG 67%

Deep Exemplar Networks for VQA and VQG

Badri N. Patro, Vinay P. Namboodiri

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments This work is an extension of CVPR-2018 accepted paper arXiv:1804.00298 and EMNLP-2018 accepted paper arXiv:1808.03986

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.02391 2019-12-04 cs.CV cs.AI cs.LG 67%

Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization

Ramprasaath R. Selvaraju, Michael Cogswell, Abhishek Das, Ramakrishna Vedantam, Devi Parikh, Dhruv Batra

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments This version was published in International Journal of Computer Vision (IJCV) in 2019; A previous version of the paper was published at International Conference on Computer Vision (ICCV'17)

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.06336 2019-10-24 cs.CV cs.AI cs.CL cs.LG 67%

What is needed for simple spatial language capabilities in VQA?

Alexander Kuhnle, Ann Copestake

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.12584 2019-04-30 cs.CV cs.AI cs.CL cs.LG 67%

The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision

Jiayuan Mao, Chuang Gan, Pushmeet Kohli, Joshua B. Tenenbaum, Jiajun Wu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICLR 2019 (Oral). Project page: http://nscl.csail.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.02338 2019-01-16 cs.AI cs.CL cs.CV cs.LG 67%

Neural-Symbolic VQA: Disentangling Reasoning from Vision and Language Understanding

Kexin Yi, Jiajun Wu, Chuang Gan, Antonio Torralba, Pushmeet Kohli, Joshua B. Tenenbaum

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2018 (spotlight). The first two authors contributed equally to this work. Project page: http://nsvqa.csail.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.07932 2018-10-22 cs.CV cs.AI cs.CL cs.LG 67%

Bilinear Attention Networks

Jin-Hwa Kim, Jaehyun Jun, Byoung-Tak Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by NIPS 2018; Figure 1 was updated

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.04284 2018-06-13 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

iParaphrasing: Extracting Visually Grounded Paraphrases via an Image

Chenhui Chu, Mayu Otani, Yuta Nakashima

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments COLING 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.01322 2018-05-15 cs.CL cs.AI cs.CV cs.LG 67%

Deep learning evaluation using deep linguistic processing

Alexander Kuhnle, Ann Copestake

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.06228 2017-12-19 cs.CV cs.AI cs.LG 67%

Visual Explanations from Hadamard Product in Multimodal Deep Networks

Jin-Hwa Kim, Byoung-Tak Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 8 pages, 5 figures, including appendix, NIPS 2017 Workshop on Visually-Grounded Interaction and Language (ViGIL)

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.11543 2017-12-04 cs.CV cs.AI cs.CL cs.LG 67%

Embodied Question Answering

Abhishek Das, Samyak Datta, Georgia Gkioxari, Stefan Lee, Devi Parikh, Dhruv Batra

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 20 pages, 13 figures, Webpage: https://embodiedqa.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.00260 2017-10-17 cs.CV cs.AI cs.LG cs.NE stat.ML 67%

Aligned Image-Word Representations Improve Inductive Transfer Across Vision-Language Tasks

Tanmay Gupta, Kevin Shih, Saurabh Singh, Derek Hoiem

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted in ICCV 2017. The arxiv version has an extra analysis on correlation with human attention

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.06585 2017-03-22 cs.CV cs.AI cs.CL cs.LG 67%

Learning Cooperative Visual Dialog Agents with Deep Reinforcement Learning

Abhishek Das, Satwik Kottur, José M. F. Moura, Stefan Lee, Dhruv Batra

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 11 pages, 4 figures, 2 tables, webpage: http://visualdialog.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
1501.03302 2015-01-16 cs.AI cs.CL cs.CV cs.LG 67%

Hard to Cheat: A Turing Test based on Answering Questions about Images

Mateusz Malinowski, Mario Fritz

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Presented in AAAI-15 Workshop: Beyond the Turing Test

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17736 2026-02-04 cs.CV cs.AI cs.CL 66%

V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction

V2P-Bench: 通过视觉提示评估视频语言理解以提升人机交互

Yiming Zhao, Yu Zeng, Yukun Qi, YaoYang Liu, Xikun Bao, Lin Chen, Zehui Chen, Qing Miao, Chenxi Liu, Jie Zhao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI;VLM(comments)

AI总结 V2P-Bench通过视觉提示评估视频语言理解,提升人机交互效率与体验,揭示模型在时空理解上的不足及Hack现象。

Comments Project Page: https://vlm-reasoning.github.io/V2P-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22279 2026-08-25 cs.CV cs.AI 新提交 62%

OVIBench: Benchmarking Online Video Question Answering under Interruption

OVIBench:面向中断场景的在线视频问答基准测试

Naiming Liu, Zhiheng Wu, Shuning Wang, Tie Zhang, Bowen Liu, Tong Wang

机构 * HIT(哈尔滨工业大学) CASIA(中国科学院自动化研究所) ZJU(浙江大学) UESTC(电子科技大学) HKUST(香港科技大学)

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对现有视频问答基准未考虑用户中断的问题,提出首个面向中断场景的在线视频问答基准OVIBench,开发模拟协议与指标集,构建训练集OVI-Train,验证了其有效性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17044 2026-08-19 cs.CV cs.AI 新提交 62%

The 10th AI City Challenge

第10届AI City挑战赛

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Munkhjargal Gochoo, Jun-Wei Hsieh, Tomasz Kornuta, Zhedong Zheng, Renran Tian, Judah Goldfeder, Fulgencio Navarro, Yuxing Wang, Yizhou Wang, Sameer Satish Pusegaonkar, Anqi Li, Nalin Dadhich, Ridham Kachhadiya, Dhanishtha Patil, Haoquan Liang, Jiajun Li, Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Shuyu Yang, Ashutosh Kumar, Rong Wang, Rafael Martin Nieto, Peter Christiansen, Ahmed Abduljawad, Mohanrasu Shanmugam, Nadeem Shaik, Sujit Biswas, Xunlei Wu, Vidya Murali, Rama Chellappa

机构 * Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota(丰田编织公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang Ming Chiao Tung University(国立阳明交通大学) University of Macau(澳门大学) North Carolina State University(北卡罗来纳州立大学) Columbia University(哥伦比亚大学) Milestone Systems(里程碑系统公司) Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。

Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13031 2026-08-14 cs.CV cs.AI 新提交 62%

UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

UniTraffic-Agent:面向2026年AI城市挑战赛第3赛道的统一交通视频推理,含两项域外评估

Peng Li, Qianqian Xu, Shilong Bao, Yangbangyan Jiang, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院) Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 UniTraffic-Agent是第10届AI城市挑战赛第3赛道的MR-CAS解决方案,采用观察-推理-行动-验证工作流,在TAR、FETV、PSI-VQA三项任务中取得相应排名,为交通视频推理提供了新方案。

Comments This paper has been accepted to ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11741 2026-08-13 cs.CV cs.AI 新提交 62%

JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

JieZi:用于古文字训诂的大规模专家审核数据集与基准

Ran Li, Huiguo He, Jiahuan Cao, Junle Liu, Hiuyi Cheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。

Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11017 2026-08-12 cs.CV cs.AI cs.HC cs.MM 新提交 62%

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang

机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。

Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering

详情

展开后加载摘要…

URL PDF HTML 收藏