arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

百度等提出CRAFT:只用1万张参考图训练个性化生成,告别百万合成配对

arXiv 2608.14403 cs.CV

给AI一张人物、宠物或物品照片,再要求它换姿势、换场景,通常需要大规模合成“参考图—目标图”配对数据。百度、DGIST、KAIST等团队提出CRAFT,只使用1万张彼此独立的参考图训练,不需要预先制作目标合成图,却能同时保持主体身份和文本指令的可编辑性。论文已被SIGGRAPH Asia 2026接收。

参考图个性化生成存在一对矛盾:复制参考图最容易保住身份,却会把原姿态、背景和构图一起带过去;听从文字重新创作,又容易把脸、花纹或物品细节改掉。此前方法常用15万到200万组合成配对,显式教模型“同一主体在另一场景里应该长什么样”,数据制作昂贵且带着合成模型的偏差。

把参考图当作视觉词汇,不再依赖目标配对图

CRAFT以FLUX.2-klein-9B为生成骨干,将参考图编码为主体视觉信息,再与文本共同控制去噪过程。训练时只有参考图片本身,系统通过重建和注意力约束学习哪些特征代表主体身份,哪些内容可以交给文字自由改变,因此省去了先生成另一幅目标图的环节。

CRAFT只使用参考图训练个性化生成的整体方法

CRAFT只使用参考图训练个性化生成的整体方法。

1万张数据相较既有路线的15万至200万配对缩小了一个到两个数量级。更少的数据不是简单减配,而是改变监督来源:模型不再模仿另一个生成器制造的“标准答案”,而是从真实参考图中提取可迁移的主体线索。

这也减少了数据流水线中的级联误差。合成目标图如果先把人物五官或产品结构画错,后续模型会把错误当作监督;只使用原始参考图时,身份依据始终来自真实输入。团队可以把数据预算用于增加主体种类,而不是为同一主体反复制造配对。

注意力重排分开“像这个人”和“按文字创作”

CRAFT的核心是参考注意力重排。参考图特征需要强到足以守住脸型、发色、服饰或物体纹理,又不能压过文本描述。团队重新组织参考与生成分支间的注意力,使主体信息在合适的层和位置进入,同时减少背景与姿态的直接拷贝。

CRAFT在人物宠物和多主体场景中的参考图生成结果

CRAFT在人物宠物和多主体场景中的参考图生成结果。

从结果看,同一个人可以出现在街道、室内或插画场景中,宠物与物品也能迁移到新的动作和构图。多参考图组合时,模型需要分别绑定文字中的人物和视觉身份,避免把两张脸或多个物体混在一起,这类组合能力比单纯复刻头像更接近创作工具。

XVerseBench检验身份保持与指令响应

团队构建XVerseBench,从身份相似度、文本遵循和视觉质量等维度评估参考图生成。CRAFT在只使用1万张无配对参考图的条件下,与依赖大规模合成配对的方法竞争,展示了数据效率。对比图也覆盖人物、动物、物品以及多主体组合,而非只在单一人脸集合上得分。

CRAFT与现有参考图个性化方法的视觉对比

CRAFT与现有参考图个性化方法的视觉对比。

身份相似度仍会受到遮挡、极端视角和参考图质量影响,复杂文字也可能与主体细节争夺控制权。这些边界出现在个性化生成的共同难点中,但CRAFT证明了不必先堆出百万级合成配对,研究重点可以转向更直接的表征学习与控制机制。

从对比样例还能看到,评价不能只看人脸余弦相似度。姿态是否按文字改变、多个主体是否正确绑定、背景有没有偷带参考图内容,都会影响可用性。XVerseBench将这些维度并列,避免一个“很像但完全不听指令”的模型凭单项指标胜出。

CRAFT注意力分析显示主体信息在生成过程中的传递

CRAFT注意力分析显示主体信息在生成过程中的传递。

下一步让个性化生成进入轻量创作流程

低数据需求使这条路线更容易适配特定领域。品牌可以用少量产品图建立稳定外观,动画团队可以保留角色设定,普通用户也有机会用几张个人照片完成连续故事或海报。若后续加入更强的局部编辑与身份授权机制,参考图生成可从单张展示走向成套内容制作。

另一个方向是视频和三维一致性:同一主体不仅要在一张图里相似,还要跨镜头保持服装、比例与细节。CRAFT的参考注意力机制提供了可扩展接口,未来可与视频扩散、角色资产和可控相机结合,在减少训练数据的同时保留创作自由度。

参考资料

https://arxiv.org/abs/2608.14403

https://jihun999.github.io/projects/CRAFT/