LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering
专题命中 视觉问答 :grounding(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :grounding(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * University College London(伦敦大学学院) ; Chulalongkorn University(朱拉隆梭大学)
专题命中 视觉问答 :VLM(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
机构 * National Yang Ming Chiao Tung University(阳明大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
机构 * Amity Centre for Artificial Intelligence, Amity University, Noida(阿米蒂人工智能中心,阿米蒂大学,诺伊达)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 8 pages, 4 figures Submitted to AAAI 26
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
Comments 7 pages, 4 figures,
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
机构 * The Hong Kong University of Science
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.AI
Comments Accepted to CIKM 2025
机构 * Kwangwoon University(韩国成均馆大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments MM 2025
机构 * MedVisAI Lab Department of ECE Northwestern University(MedVisAI实验室 电子工程系 西北大学) ; Institute for Infocomm Research (I 2 R) A*STAR, Singapore(信息与通信研究所(I 2 R)A*STAR,新加坡) ; MedVisAI Lab Lee Kong Chian School of Medicine, Nanyang Technological University(MedVisAI实验室 李科田医学院,南洋理工大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * Southern University of Science and Technology(南方科技大学) ; Wangxuan Institute of Computer Technology, Peking University(北京大学王瑄计算机技术研究所)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments 13 pages, 16 figures, accepted by ACM MM 2025
机构 * School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) ; DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments This work has been accepted by IEEE Transactions on Multimedia
机构 * University of Malaya(马来大学)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)
Comments 24 pages, 3 figures, 9 tables
机构 * Old Dominion University(旧 Dominion 大学) ; AnaletIQ ; McDonald Army Health Center(麦克唐纳陆军医疗中心) ; University of Sri Jayewardenepura(Sri Jayewardenepura 大学) ; University of Gdańsk(盖尔范大学) ; University of Colombo(科伦坡大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * State Key Laboratory of Industrial Control Technology(工业控制技术国家重点实验室) ; Institute of Cyber-Systems and Control(网络系统与控制研究所) ; Zhejiang University(浙江大学) ; Zhejiang Humanoid Robot Innovation Center Co., Ltd.(浙江人形机器人创新中心有限公司)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract)
机构 * Independent Researcher(独立研究者)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision-language model(title,abstract)
机构 * Universiti Teknologi Malaysia(马来西亚技术大学)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV
机构 * UC San Diego(UC圣地亚哥大学) ; Carnegie Mellon University(卡内基梅隆大学) ; MBZUAI(马斯克人工智能研究所)
专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
专题命中 视觉推理 :vision language model(abstract);分类 cs.LG
机构 * Computational Linguistics, Department of Linguistics University of Potsdam(乌特雷赫特大学语言学系计算语言学部) ; German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)柏林)
专题命中 视觉推理 :grounding(abstract)
Comments 17 pages
机构 * GIST(韩国科学技术院) ; Seoul National University(首尔国立大学) ; POSTECH
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to ICCV 2025
机构 * Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) ; University of Adelaide(阿德莱德大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV
Comments Accepted to ICCV 2025
机构 * Media Evaluation Lab, ByteDance Inc.(字节跳动公司媒体评估实验室)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * IRMV Lab, the Department of Automation, Shanghai Jiao Tong University(IRMV实验室,自动化系,上海交通大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Extended journal version of arXiv:2506.03662
机构 * Arizona State University(亚利桑那州立大学) ; Clemson University(克莱姆森大学) ; LinkedIn Corporation(领英公司) ; Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG
机构 * Keio University(庆应大学) ; University of Stuttgart(斯图加特大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
Comments This work is a pre-print version of a paper that has been accepted to the IEEE International Symposium on Mixed and Augmented Reality for future publication. Project Page: https://mediated-reality.github.io/projects/yasunaga_ismar25/