Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction
仅文本训练的图像描述生成:结合检索增强与模态差距校正
机构 * INESC-ID, Instituto Superior Tecnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)
AI总结 TOMCap通过检索增强和模态差距校正,实现无需对齐图像-文本对的纯文本训练图像描述生成。
Comments Submitted to CVPR 2026