Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
机构 * Univerisy of Florida(佛罗里达大学)
专题命中 视觉问答 :vision language model(title,abstract);grounding(title,abstract);VLM(abstract);InternVL(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Univerisy of Florida(佛罗里达大学)
专题命中 视觉问答 :vision language model(title,abstract);grounding(title,abstract);VLM(abstract);InternVL(abstract)
机构 * University of Copenhagen(哥本哈根大学) ; Microsoft(微软) ; University of Cambridge(剑桥大学)
专题命中 视觉问答 :vision-language model(title);分类 cs.CV
机构 * Università degli Studi di Firenze(佛罗伦萨大学)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract)
机构 * Department of Computer Science(计算机科学系) ; The University of British Columbia(不列颠哥伦比亚大学) ; ServiceNow Research(ServiceNow研究)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Findings of EMNLP 2025
机构 * Huawei Technologies Co.(华为技术有限公司) ; South China University of Technology(南方科技大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
机构 * University of Washington(华盛顿大学) ; Salesforce Research(Salesforce研究)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
Journal ref EMNLP 2025