MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning
MILR:通过测试时潜在推理改进多模态图像生成
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 MILR通过测试时潜在推理提升多模态图像生成性能,实现跨模态推理和统一潜在空间优化。
Comments 21 pages,14 figures,9 tables