VideoQA in the Era of LLMs: An Empirical Study
机构 * National University of Singapore(新加坡国立大学) ; Communication University of China(中国传媒大学) ; Sun Yat-Sen University(中山大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
Comments IJCV'25
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * National University of Singapore(新加坡国立大学) ; Communication University of China(中国传媒大学) ; Sun Yat-Sen University(中山大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
Comments IJCV'25
机构 * Huawei Cloud Computing(华为云计算)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
机构 * Simula Metropolitan Center for Digital Engineering (SimulaMet)(Simula Metropolitan Center for Digital Engineering) ; Oslo Metropolitan University (OsloMet)(Oslo Metropolitan University) ; Simula Research Laboratory
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Technical University of Munich(慕尼黑技术大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
机构 * Jožef Stefan Institute(乔泽夫·斯塔芬研究所)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
Comments To-appear as a book chapter
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Our Code can be found at https://github.com/adityavavre/VidEgoVLM
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Illinois Fire Service Institute(伊利诺伊州消防服务研究所)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 20 pages, 9 figures, 6 tables
机构 * University of Helsinki(赫尔辛基大学) ; Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) ; CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍茨中心) ; INRIA(法国国家信息与自动化技术研究所) ; Yooz ; Carnegie Mellon University(卡内基梅隆大学) ; NTT(日本NTT公司) ; Institute of Science Tokyo(东京科学研究所) ; Department of Computer Science(计算机科学系) ; Mphasis AI & Applied Tech Lab at Ashoka, Ashoka University(阿什oka大学人工智能与应用技术实验室) ; Koita Centre for Digital Health - Ashoka (KCDH-A)(阿什oka数字健康中心(KCDH-A)) ; Trivedi School of Biosciences, Ashoka University(阿什oka大学Trivedi生物科学学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments 33 pages, 7 figures; published in TMLR 06/2025 https://openreview.net/forum?id=3HKNwejEEq
Journal ref Transactions on Machine Learning Research, ISSN 2835-8856, 2025
机构 * Boston University(波士顿大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted at CVPR 2025 workshops (AI4CC (oral) & GMCV (poster))
机构 * ByteDance(字节跳动) ; Nanyang Technological University(南洋理工大学) ; Southwest Jiaotong University(西南交通大学) ; Great Bay University(大湾大学) ; Shenzhen University(深圳大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICME 2025
机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) ; School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) ; School of Engineering, Westlake University(工程学院,西湖大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
Comments 12 pages, 5 figures, 4 tables
机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) ; College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) ; State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence(一般人工智能国家重点实验室) ; Yuanpei College, Peking University(北京大学元培学院) ; Tsinghua University(清华大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * University of Copenhagen(哥本哈根大学) ; Sony AI(索尼人工智能) ; University of Zaragoza(阿拉维萨大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Tsinghua University(清华大学) ; Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) ; University of Freiburg(弗赖堡大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments ICLR 2025 accepted paper. Project url: https://xingruiwang.github.io/projects/DynSuperCLEVR/
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments Spotlight, Machine Learning for Genomics Explorations @ ICLR 2025
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments CVPR 2025 Camera Ready Version. Project Page: https://videochat-online.github.io
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments The first two listed authors contributed equally to this work
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments update
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments ICLR 2025
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR2025
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 11pages
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Published in Information
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments 10 pages, 3 figures, AAAI-25 Workshop on Document Understanding and Intelligence
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted by IJCAI 2024
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG
Comments In Proceedings ICLP 2024, arXiv:2502.08453
Journal ref EPTCS 416, 2025, pp. 168-174
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments In Proceedings ICLP 2024, arXiv:2502.08453. This work was partially funded from the Bosch Center for AI
Journal ref EPTCS 416, 2025, pp. 15-28