论文导读
微软与弗吉尼亚理工大学提出主体清晰度外扩框架,专门处理人物、车辆或文字被裁掉一部分的难题。它用视觉语言提示确认主角,再以多尺度小波监督补回局部细节;四套基准上,相比各数据集最强方法,主体误差平均降10.8%,结果仍取决于原图与主体类型。
背景补得漂亮,主角却可能变了
广告图和商品图常要改成横幅、竖版或不同屏幕比例。传统外扩擅长在画面边缘补天空、墙面和地面,但当原图恰好裁掉车灯、脸的一侧、招牌或动物身体时,模型容易生成“看起来合理”的另一种结构。整体画质不错,主体身份和细节却被改写。
论文图:视觉语言模型提供主体语义,受影响区域在多尺度小波空间接受监督。
研究把这个问题称为主体清晰度:扩出的内容不仅要自然,还要和原图里可见的主体保持身份、结构、外观与边界连续。它比一般背景补画更强调“别动主角”。
语义提示管方向,小波约束管细节
框架先让视觉语言模型识别主要主体和场景,为扩散外扩骨干提供语义条件。训练时,再把预测图与真值放进多级小波空间比较,重点检查主体相交区域的高低频信息。轮廓、颜色块和细纹被拆到不同尺度,模型不容易只追求整体合理而忽略局部错位。
论文图:车灯和列车等案例展示主体延续是否发生结构错位。
损失还会根据主体频率统计和噪声阶段调整各子带权重。训练完成后,这套监督不参与推理,因此论文称不会增加额外推理成本,也能接到已有扩散主干上。
四套基准分别看主体和整图
团队从广告与自然图像构建主体相交的外扩对,刻意把裁切边界放在主要对象上。与匹配的监督微调相比,主体中心DreamSim误差平均降低3.0%,FID降低2.4%;与每个数据集上的最强现有方法相比,两项误差分别降低10.8%和7.7%。
论文图:噪声日程与子带自适应组件的定性消融对比。
DreamSim侧重主体感知差异,FID反映整体生成分布,两者同时改善说明方法没有只顾局部。但平均值来自四套测试集,某类人脸、文字、品牌标识或极端裁切是否可靠,仍要逐类检查。
定性样例中,通用方法会把车灯形状接错或让列车结构断开,本文结果更接近原主体延伸方向。这些对比直观,但仍应与量化指标一起看,避免只挑成功案例。
下一步进入广告生产检查链
这项技术适合电商主图改版、海报多尺寸生成和社交媒体素材重排。真正上线时,应把主体区域自动检测、文字与标志识别、人工预览放在同一流程中,并记录哪些扩图改动了身份特征。若能加入可控的“禁止改动区”,设计师会更容易把模型当作画布扩展工具,而不是重新抽一次盲盒。