arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

京东等用一个模型生成和修改图片文字,专门解决中文小字难题

作者:arXivDaily编辑部 arXiv 2607.22101 cs · cs.CV

图片生成模型可以画出复杂场景,却经常把招牌、海报和包装上的中文写错,字号一小更容易变形。京东、中山大学深圳校区、中国科学院大学、浙江大学团队提出InnoText,让同一个扩散Transformer同时负责视觉文字生成和编辑,并专门训练中文复杂字形与小字符。

论文构建了覆盖中英文、不同字体、字号和背景的数据,给生成与编辑任务使用不同输入形式,但共享模型主干。它是研究模型,不是已经上线的京东图片编辑产品。

生成文字和原地改字共用一个模型

视觉文字生成从提示词直接创建带文字的画面;视觉文字编辑则要在保留原背景、风格和布局的情况下替换指定内容。过去两类任务常用独立模型,数据、输入条件和训练目标重复。

论文Figure 1:同一模型完成图片文字生成与已有画面中的文字编辑。

InnoText用上下文学习形式统一任务。编辑模式输入原图、文字区域和目标内容;生成模式从提示与布局条件创建画面。任务标签、输入范式和区域权重告诉模型当前需要“从头写”还是“在原位改”。

字号图让模型知道哪里最难写

小字符在潜空间中只占很少位置,普通损失容易被大面积背景淹没。团队加入字号感知调制,根据文字区域大小动态调整注意力,并使用小字符感知增强,选择性放大训练中的小字号样本。

论文Figure 5:生成与编辑采用不同输入形式,字号图、FSAM和小字符增强共同处理细粒度文字。

区域加权损失进一步提高文字位置的训练权重。模型仍要学习背景质感,但文字笔画不会被整幅图像的像素平均掉。

中文复杂字形和小字直接做视觉对比

论文比较UNet与DiT类视觉文字方法,展示不同字号下的字符清晰度。中文笔画密集,错误往往表现为部件粘连、缺笔或结构扭曲;小字号会放大这些问题。

论文Figure 3:UNet与DiT类模型在不同字号和复杂字形上的生成结果。

编辑结果还要检查新文字是否与背景光照、纹理和排版一致。案例覆盖复杂背景、竖排文本与不同大小文字,InnoText在保持原图环境的同时替换目标内容。

论文Figure 6:复杂背景、不同字号和竖排布局下的文字编辑结果。

定性图片只展示选定案例。实际海报可能包含更长文案、极小字号、弯曲表面和特殊字体,仍会出现字符错误;论文也单独列出失败样例,没有证明任意中文排版都能稳定处理。

生成与编辑共用主干,带来的主要收益是任务统一和能力复用,不等于一次推理同时完成两项任务。模型仍根据输入范式判断当前是从提示生成,还是在指定区域替换文字;编辑模式还需要原图和区域条件。用户工作流变简单,背后依然存在不同的条件准备。

中文小字也不能只靠视觉锐度验收。一个字可能看起来规整,却在偏旁、笔画或语义上出错;连续文案还涉及漏字、重复和顺序问题。论文的视觉对比说明模型更重视小字号区域,产品应用仍需OCR或人工逐字复核,尤其是价格、型号和合规文案。

统一训练还要平衡两类数据比例。如果生成样本过多,模型可能忽视编辑时的背景保持;编辑样本过多,又可能限制从零构图的多样性。论文结果说明该配方在既定数据上可行,但迁移到品牌素材或专业字体仍需重新验证。

下一步是长文本、排版约束和产品交互

统一模型可以减少生成工具在“先做图、再改字”之间切换管线,适合海报、包装、广告素材和电商图片的迭代编辑。对用户而言,更关键的是指定区域能否只改文字,不破坏已经确认的背景。

后续需要增加长句、多段落、弧形文字和品牌字体测试,并提供逐字校验与局部重试机制。视觉效果合格不等于文字内容正确,产品化时仍要把OCR复核、字体版权和编辑历史接入生成流程。

参考资料

https://arxiv.org/abs/2607.22101

https://arxiv.org/html/2607.22101