MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract)
Comments Accepted by EMNLP 2025 findings
机构 * Hangzhou Institute for Advanced Study, UCAS(杭州高等研究 institute,UCAS) ; Zhejiang Lab(浙江实验室) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI
Comments Accepted by EMNLP 2025 Main conference
机构 * Brown University(布朗大学) ; University of Warwick(沃里克大学) ; Samsung US(三星美国分公司) ; Boston University(波士顿大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Rutgers University(罗格斯大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments COLM 2025, 30 pages, 10 figures, 16 tables