arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

商汤&北航等提出MaskFlow,局部修图不再留下生硬接缝

arXiv 2608.06929 cs.AI · cs.CV

给花朵换颜色、改海报上的文字,生成模型往往能改对内容,却在掩码边缘留下色差、硬线或纹理断裂。商汤研究院、北京航空航天大学与南洋理工大学等团队提出MaskFlow,把编辑区域直接写进生成路径,并用Soft-Poisson机制处理边界融合。完整方法将FID从29.85降至19.90,背景保真PSNR由19.11升至22.60。

局部编辑有三种常见露馅方式

局部图像编辑同时接收原图、文字指令和掩码。模型需要在指定区域生成新内容,区域之外尽量一像素不动,交界处还要自然连续。只强调指令遵循,可能把修改扩散到背景;只把掩码当作额外条件,模型又未必在整条生成轨迹中严格遵守边界。

第三个问题最直观:即使前景和背景各自正确,二者拼在一起仍可能像贴纸。亮度、颜色梯度和纹理方向在掩码边缘突然变化,人眼很容易发现。MaskFlow因此没有把边界问题留给最后一次后处理,而是把它放进训练与采样过程。

MaskFlow与其他局部编辑方法的结果对比

评价局部编辑时,目标内容、未编辑背景和边缘连续性需要同时成立。

让掩码进入概率流

MaskFlow基于流匹配构建一条掩码感知的概率路径。需要修改的区域沿生成轨迹逐步变成目标内容,掩码之外则由源图约束,减少无关区域漂移。这样,掩码不再只是提示模型“看这里”,而是决定不同像素在概率流中承担的角色。

为了补充训练数据,团队还建立MEData合成流程:视觉语言模型负责理解编辑意图和区域,图像生成模块构造前后对应样本,再形成图像、掩码、指令和目标结果的组合。它覆盖自然图像与信息图等不同内容,帮助模型学习文字替换、物体变化和属性修改。

MaskFlow的训练与推理流程

掩码参与生成路径,使编辑区域与保留区域从训练开始就受到不同约束。

Soft-Poisson把接缝放进优化

传统Poisson融合关注梯度域连续性,但直接套用可能过度改变生成结果。MaskFlow提出Soft-Poisson,在训练和采样阶段以柔性的梯度约束协调内外区域。它允许新内容保留语义和细节,同时降低边界两侧亮度、色彩和纹理的突变。

消融实验给出了两部分的独立贡献。基础方法FID为29.85、PSNR为19.11;加入掩码流后,FID降至20.51,PSNR升至22.38;再加入Soft-Poisson,FID进一步降至19.90,PSNR达到22.60。也就是说,主要提升来自更明确的区域建模,而边缘机制在此基础上继续改善融合。

这两类指标也对应不同用户感受。FID下降意味着编辑后的整体图像更接近真实图像分布,PSNR上升则说明掩码外的原图被保留得更多。若只追求前者,模型可能重绘整张图来获得自然外观;若只追求后者,又可能什么都不敢改。MaskFlow同时报告二者,并用视觉对比检查接缝,才能证明改动集中在该改的位置。

MaskFlow与多种编辑模型的定量和视觉比较

FID衡量生成分布,PSNR用于观察未编辑内容保留情况,两者共同避免“改得好但背景全变”。

下一步进入更复杂的局部编辑

MaskFlow适合边界清楚、目标明确的局部修改,尤其是花朵换色、人物或动物局部变化、信息图内容重绘。它把“不要动哪里”和“交界处怎么融”变成显式问题,比只追求文本匹配更贴近真实修图需求。

下一步可以把掩码流和Soft-Poisson用于人像发丝、透明材质、阴影与反射等更复杂边界,并把文字重绘、商品图调整和多区域批量编辑纳入同一套训练。编辑工具还可以在用户画出粗略区域后自动细化掩码,减少手工描边成本。

系统目前仍依赖掩码质量,大范围几何变化也超出简单局部融合的范围。后续评测可以把指令理解、掩码误差和生成误差分别统计,再观察不同边界类型的成功率。MaskFlow已经把目标内容、背景保留和接缝质量拆成可训练指标,为修图产品建立更精确的局部编辑验收方式。

参考资料

https://arxiv.org/abs/2608.06929

https://reychiaro.github.io/MaskFlow/