arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

PAPERDAILY REPORTS

海报别靠嘴排版!复旦等让AI照着画布摆文字和图片

作者:arXivDaily编辑部 arXiv 2610.12230 cs · cs.AI · cs.CV

论文导读

复旦大学、微软研究院等机构提出Compo,让用户在画布上安排图片、文字和位置,再生成海报。输入可以明确某个人物放哪里、文字写什么、哪些部分保持原样。它将布局要求变成空间约束,减少仅靠长提示词描述排版时的歧义。

标题在上面,人物在右边,直接摆出来

用户想做一张海报,通常不只在意“画面里有两个人”。两个人的位置、文字的拼写与大小、背景留白,都会影响最后能不能用。Compo的示例把这些要求先放进画布,再让图像编辑模型生成结果。

图:输入画布明确人物、文字与空间位置,输出为对应人物海报。

输入画布上的区域与参考图片告诉模型对象身份和位置,文本指定内容,已有像素还能表达哪些部分需要保留。用户不用把整个二维布局翻译成一长段方位描述。

论文示例中,人物、海报标题和背景装饰被分别指定。图像结果展示的是这一组要求的组合,不代表任何文字和任意复杂布局都能一次生成正确。

四种约束,把内容与位置绑在一起

Compo将空间输入拆成四类约束。语义约束说明区域里要出现什么;身份约束用参考图指定具体对象;文字约束交代要写的内容及位置;像素约束保留用户已经确定的画面部分。

图:代理先安排空间布局,再调用图像生成流程完成海报。

这几种要求可以同时存在。把人物挪到指定区域,不能顺手改掉身份;保留背景也不能阻止新增标题。模型需要理解要求之间的关系,并在生成图里同时兑现。

研究基于已有图像编辑骨干进行适配,涉及LongCat与Qwen等模型,并非从零训练一个完整设计软件。训练使用结构化海报样本,反馈检查文字、对象和布局是否与输入一致。

对用户来说,画布将一部分沟通成本提前变成明确坐标。对模型来说,难点从“猜用户想放哪里”转到“按明确约束同时生成多个内容”,约束仍可能彼此冲突。

也能让代理先规划画布

除了用户直接摆放,Compo还展示了代理规划模式:代理把要求拆成布局计划,再调用生成流程完成海报。规划给出内容位置,图像模型负责把这些要求落到画面中。

图:同一画布条件下的不同方法结果,比较文字与对象位置。

自动规划不能取代结果检查。文字是否拼对、人物是否对应参考图、对象是否放在正确区域,需要分别核对。画面风格好看但文字错了,不能算完整完成海报任务。

论文的定性对照将不同方法在同一空间要求下的结果并排展示,能够看出文字与人物位置的区别。单个示例对照支持该任务上的观察,不能据此声称模型全面超过所有设计工具。

项目页面展示了画布与输出样例,代码仓库也提供项目资料。文章不把仓库页面存在当成模型权重已公开,更不将论文演示描述成已经上线的商业排版服务。已有验证集中在空间条件、编辑模型与海报生成测试上。

参考资料

https://arxiv.org/abs/2610.12230

https://snowflakewang.github.io/Compo-Page/

https://github.com/snowflakewang/Compo

↑