Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
联合视觉-语言空间中的生成编辑用于零样本复合图像检索
机构 * Renmin University of China(中国人民大学) ; Alibaba Group(阿里巴巴集团)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 Fusion-Diff通过联合视觉-语言空间中的生成编辑策略,实现了高效的零样本复合图像检索,提升了多模态对齐的性能和可解释性。