MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV
Comments Under Review
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV
Comments Under Review
机构 * Graduate School(研究生院) ; Faculty of Information Science(信息科学系) ; Electrical Engineering(电气工程) ; Kyushu University(九州大学) ; JAPAN(日本)
专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract)
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025
专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV
Comments 9 pages, 6 figures
机构 * BUPT(北京邮电大学) ; WeChat Vision, Tencent Inc.(腾讯公司) ; Tsinghua University(清华大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Working in progress
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Department of Computer Science, University of Manchester, UK(曼彻斯特大学计算机科学系) ; National Biomarker Centre, CRUK-MI, University of Manchester, UK(曼彻斯特大学国家生物标志物中心) ; Idiap Research Institute, Switzerland(日内瓦IDIAP研究所) ; School of Computer Science, University of Sheffield, UK(谢菲尔德大学计算机科学学院)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
Comments 19 pages