LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering
专题命中 视觉问答 :grounding(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :grounding(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * University College London(伦敦大学学院) ; Chulalongkorn University(朱拉隆梭大学)
专题命中 视觉问答 :VLM(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
机构 * National Yang Ming Chiao Tung University(阳明大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
机构 * Amity Centre for Artificial Intelligence, Amity University, Noida(阿米蒂人工智能中心,阿米蒂大学,诺伊达)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 8 pages, 4 figures Submitted to AAAI 26
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
Comments 7 pages, 4 figures,
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
机构 * The Hong Kong University of Science
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.AI
Comments Accepted to CIKM 2025
机构 * Kwangwoon University(韩国成均馆大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments MM 2025
机构 * MedVisAI Lab Department of ECE Northwestern University(MedVisAI实验室 电子工程系 西北大学) ; Institute for Infocomm Research (I 2 R) A*STAR, Singapore(信息与通信研究所(I 2 R)A*STAR,新加坡) ; MedVisAI Lab Lee Kong Chian School of Medicine, Nanyang Technological University(MedVisAI实验室 李科田医学院,南洋理工大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * Southern University of Science and Technology(南方科技大学) ; Wangxuan Institute of Computer Technology, Peking University(北京大学王瑄计算机技术研究所)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments 13 pages, 16 figures, accepted by ACM MM 2025
机构 * School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) ; DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments This work has been accepted by IEEE Transactions on Multimedia