arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2025-12-05 至 2025-12-05 共收录 1
2512.04309 2025-12-05 cs.CV cs.CL

Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction

仅文本训练的图像描述生成:结合检索增强与模态差距校正

Rui Fonseca, Bruno Martins, Gil Rocha

机构 * INESC-ID, Instituto Superior Tecnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)

AI总结 TOMCap通过检索增强和模态差距校正,实现无需对齐图像-文本对的纯文本训练图像描述生成。

Comments Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏