arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

美团等做出无掩码视频试衣,大动作遮挡也能保持衣服细节

作者:arXivDaily编辑部 arXiv 2609.04120 cs · cs.CV

论文导读

美团、中国科学技术大学、南京理工大学、新加坡国立大学等机构提出BooM-VVT,让视频虚拟试衣不再需要用户提供试衣区域掩码。方法用图像级伪数据学习定位,并在大动作、遮挡和多视角条件下保持服装细节;成绩来自论文数据集与作者比较,尚不代表任意自拍视频都能稳定处理。

掩码在大动作和遮挡时容易失效

传统视频试衣常让系统先标出需要替换服装的区域。人物正面站立时,这个掩码容易获得;一旦转身、挥手或被物体遮挡,边界会随帧变化,衣服纹理可能粘到背景,身体也可能被误改。为视频逐帧制造高质量伪掩码,成本又远高于单张图。

BooM-VVT改用多阶段训练:先从大量图像级伪数据学会“衣服应落在哪些身体区域”,再把这种定位能力迁到关键帧驱动的视频生成器。推理时不要求额外输入区域掩码。

图:项目页图1展示大动作、严重遮挡、多视角和多类服装任务中的试衣结果。

关键帧不再只按固定间隔抽取

视频生成通常选择少量关键帧处理,再补齐中间画面。固定间隔会错过转身或衣摆展开的瞬间,后续帧只能依据不完整的服装信息。团队提出服装敏感关键帧采样,优先选择与上衣、下装等目标区域相关的身体姿态。

Frame-Shared 3D-RoPE则让不同关键帧与目标帧共享时空位置关系,用于追踪同一块衣料在视角和姿态变化后的对应位置。两步分别解决“选哪些帧”和“如何把细节传过去”。

图:项目页图3展示服装敏感关键帧选择、多帧试衣和视频生成的连接。

OmniView补上多视角试衣数据

现有数据往往集中于正面和简单动作,难以覆盖背面、侧面、上下装组合及复杂遮挡。论文构建OmniView多视角试衣数据集,用于训练模型在更广的相机位置和任务类型下恢复服装细节。

作者在图像质量、服装相似度和时序一致性指标上比较多种方法,并给出大量定性结果。论文结论是BooM-VVT在其设置中取得更稳定的衣服外观与时间连续性;公开摘要没有把某一个数字定义为所有场景的统一提升,因此标题保留方法能力而不写全面领先。

图:项目页训练框架展示图像级伪数据如何先训练无掩码定位,再迁移到视频生成。

产品化还要处理真实视频的长尾输入

无掩码能减少用户准备步骤,也能避开掩码误差沿视频传播。不过消费端输入还会遇到低照度、强运动模糊、多人同框、宽松衣料和手持镜头抖动,论文数据不能覆盖全部组合。

下一步适合公开更多数据构成与逐任务指标,并测试长视频中颜色、图案和衣服结构是否持续稳定。若系统进入购物场景,还需单独评估身材保持与商品细节是否忠实,避免生成效果代替真实尺码判断。

参考资料

https://arxiv.org/abs/2609.04120

https://github.com/ModelTC/LightX2V/tree/main/examples/boom_vvt