UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
UM-Text: 一种统一的多模态模型用于图像理解和视觉文本编辑
机构 * Sun Yat-sen University(中山大学)
AI总结 本文提出UM-Text模型,通过自然语言指令实现图像理解和视觉文本编辑,引入VLM处理指令和参考图像,结合UM-Encoder生成风格一致的文本图像,并提出区域一致性损失和三阶段训练策略,最终在多个基准上取得最佳性能。
Comments Accepted by AAAI 2026