Eliminating Hallucination in Diffusion-Augmented Interactive Text-to-Image Retrieval
消除扩散增强交互式文本到图像检索中的幻觉
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract)
AI总结 本文提出DMCL框架,通过引入语义一致性和扩散感知对比目标,有效消除DAI-TIR中的幻觉问题,提升检索性能。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
消除扩散增强交互式文本到图像检索中的幻觉
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract)
AI总结 本文提出DMCL框架,通过引入语义一致性和扩散感知对比目标,有效消除DAI-TIR中的幻觉问题,提升检索性能。
GenAgent:通过代理多模态推理扩展文本到图像生成
机构 * Fudan University(复旦大学) ; Tongyi Lab(通义实验室) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV
AI总结 GenAgent通过代理多模态推理提升文本到图像生成性能,采用两阶段训练策略实现自主多轮交互与任务自适应推理。
在电子商务目录中评估多模态大语言模型用于缺失模态补全
机构 * University of Glasgow(格拉斯哥大学) ; Telefónica Scientific Research(电信科研机构) ; National University of Singapore(新加坡国立大学) ; Shandong University(山东大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。