M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning
M3:通过多模态、多智能体和多轮视觉推理实现高保真的文本到图像生成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)
AI总结 M3通过多智能体和多轮视觉推理提升开源模型的文本到图像生成能力,超越商业系统并实现最先进的性能。