低清商品图里的针织花纹已经糊成一片,生成式超分常会补出看似清晰、实际不存在的纹理。阿里淘天集团、中国科学院大学提出GraftSR,不让模型凭经验猜细节,而是读取同一件商品的另一张高清照片,把可确认的纹理移到目标位置。
论文构建TexRefSR-141K,共14.1万组带互补掩码的参考数据,并在TexRefSR-Eval上比较多种参考超分方法。GraftSR的LPIPS比表现最好的基线降低20.2%。它依赖同一实例参考图,适用条件与完全没有参考的通用超分不同。
“同款高清图”仍可能完全对不上位置
电商相册会从正面、侧面和细节拍同一件衣服。参考图的纹理真实,但视角、姿态、遮挡和背景不同,直接对齐容易把袖口花纹贴到衣身,或把背景书架特征带进商品。
论文Figure 1:低清输入、同一实例参考图与GraftSR输出的细粒度纹理对比。
GraftSR把问题拆成两个判断:“参考图里哪些区域值得提取”和“目标图里哪些位置允许注入”。两张掩码分别约束纹理来源与目标位置,避免用一次脆弱的像素级配准承担全部工作。
双掩码把提取与落点分开处理
模型先从参考图抽取多尺度特征,再用参考掩码滤掉背景与无关区域。目标掩码限定纹理注入范围,跨视角注意力只在可能对应的区域寻找联系。低清输入仍提供结构和整体颜色,扩散主干负责恢复图像,参考分支负责提供可信细节。
论文Figure 2:双掩码参考引导分别控制纹理从哪里提取、向目标哪里注入。
这种设计不要求两张照片逐像素对齐。若参考图只展示局部,模型可以在目标掩码内使用有限纹理;参考缺失或不匹配时,论文另做鲁棒性实验,说明错误参考仍会影响输出,因此实际系统需要先确认商品身份。
14.1万组数据来自多视角商品图库
现有超分数据多用高清图人工降质,只提供低清与真值,没有同一实例的另一视角。团队从多视角图库检索同实例图片,用视觉语言模型辅助筛选,再生成互补空间掩码,得到TexRefSR-141K。
论文Figure 3:从多视角图库检索同实例三元组,并生成训练所需掩码。
评测集同时包含合成退化和真实低清图。LPIPS衡量感知差异,降低20.2%说明结果更接近参考真值的视觉分布;它不等于所有细节都恢复正确,因此论文还提供定性对比和用户研究。
下一步:电商修图先解决参考身份确认
对比图中,GraftSR在蕾丝、针织图案和衣服印花上更接近参考照片,一些基线会平滑纹理或生成错误重复图案。
论文Figure 5:合成与真实低清样例中,不同方法恢复材质和花纹的结果。
电商平台最容易获得同款多视角照片,因而是直接应用场景。下一步需要把SKU身份、颜色版本和拍摄批次纳入参考检索,避免相似商品被误当成同一实例;在人像老照片等没有可靠同实例参考的场景,这套方法不能直接替代无参考超分。
上线前还要把“找参考图”和“做超分”拆成两道可审计流程。检索系统应给出同一SKU、颜色与细节区域的匹配依据;若置信度不足,超分模型应退回无参考模式或保留原图,而不是强行注入纹理。对商品文字和商标,像素看起来更锐利仍不代表字符内容正确,需要单独的OCR一致性检查。
训练集来自多视角图库,平台照片的灯光和构图较规范。用户随手拍会出现运动模糊、强压缩、反光与遮挡,参考图也可能只覆盖另一侧。后续评测应按退化类型和可见区域分别报告,而不是只给一个平均LPIPS;这样才能知道20.2%的优势在哪些输入上仍然成立。
参考图无法覆盖的区域也应明确标记,避免用户把生成细节误认为被真实照片验证过。
参考资料
https://arxiv.org/abs/2608.25334