GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
GoT-R1:通过强化学习提升MLLM的视觉生成推理能力
机构 * HKU MMLAB(香港大学多媒体实验室) ; CUHK MMLAB(香港中文大学多媒体实验室) ; Sensetime(商汤科技) ; Beihang University(北京航空航天大学) ; SUAT(上海人工智能实验室)
AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。
Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026