WebQA: Multihop and Multimodal QA
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR Camera ready
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR Camera ready
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by 2021 ACMMM Open Source Software Competition. Source code: https://github.com/YehLi/xmodaler
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 14 pages
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICML 2021 (15 pages, 4 figures, 14 tables)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 10 pages
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 4 pages, 1 reference page, 5 figures, 4 tables
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Presented at WACV, 2020
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to CVPR 2019; revised version includes bottom-up features
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments This work is an extension of CVPR-2018 accepted paper arXiv:1804.00298 and EMNLP-2018 accepted paper arXiv:1808.03986
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments This version was published in International Journal of Computer Vision (IJCV) in 2019; A previous version of the paper was published at International Conference on Computer Vision (ICCV'17)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICLR 2019 (Oral). Project page: http://nscl.csail.mit.edu/
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments NeurIPS 2018 (spotlight). The first two authors contributed equally to this work. Project page: http://nsvqa.csail.mit.edu
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by NIPS 2018; Figure 1 was updated
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments COLING 2018
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 8 pages, 5 figures, including appendix, NIPS 2017 Workshop on Visually-Grounded Interaction and Language (ViGIL)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 20 pages, 13 figures, Webpage: https://embodiedqa.org/
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted in ICCV 2017. The arxiv version has an extra analysis on correlation with human attention
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 11 pages, 4 figures, 2 tables, webpage: http://visualdialog.org/
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Presented in AAAI-15 Workshop: Beyond the Turing Test
V2P-Bench: 通过视觉提示评估视频语言理解以提升人机交互
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Xi’an Jiaotong University(西安交通大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI;VLM(comments)
AI总结 V2P-Bench通过视觉提示评估视频语言理解,提升人机交互效率与体验,揭示模型在时空理解上的不足及Hack现象。
Comments Project Page: https://vlm-reasoning.github.io/V2P-Bench/
OVIBench:面向中断场景的在线视频问答基准测试
机构 * HIT(哈尔滨工业大学) ; CASIA(中国科学院自动化研究所) ; ZJU(浙江大学) ; UESTC(电子科技大学) ; HKUST(香港科技大学)
专题命中 视觉问答 :vision language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对现有视频问答基准未考虑用户中断的问题,提出首个面向中断场景的在线视频问答基准OVIBench,开发模拟协议与指标集,构建训练集OVI-Train,验证了其有效性。
Comments EMNLP 2026
第10届AI City挑战赛
机构 * Santa Clara University(圣克拉拉大学) ; University at Albany, SUNY(纽约州立大学奥尔巴尼分校) ; Iowa State University(爱荷华州立大学) ; Woven by Toyota(丰田编织公司) ; United Arab Emirates University(阿拉伯联合酋长国大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学) ; University of Macau(澳门大学) ; North Carolina State University(北卡罗来纳州立大学) ; Columbia University(哥伦比亚大学) ; Milestone Systems(里程碑系统公司) ; Xi’an Jiaotong University(西安交通大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。
Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026
UniTraffic-Agent:面向2026年AI城市挑战赛第3赛道的统一交通视频推理,含两项域外评估
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院) ; Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) ; Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 UniTraffic-Agent是第10届AI城市挑战赛第3赛道的MR-CAS解决方案,采用观察-推理-行动-验证工作流,在TAR、FETV、PSI-VQA三项任务中取得相应排名,为交通视频推理提供了新方案。
Comments This paper has been accepted to ECCV 2026 AI City Challenge Workshop
JieZi:用于古文字训诂的大规模专家审核数据集与基准
机构 * South China University of Technology(华南理工大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。
Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation
R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆
机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。
Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering