Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
文本打印图像:为以文本为中心的大型视觉-语言模型训练弥合图像-文本模态差距
机构 * Turing Inc.(图灵公司) ; Institute of Science Tokyo(东京科学研究院) ; The University of Tokyo(东京大学) ; Tohoku University(东北大学)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究提出文本打印图像(TPI)技术,通过生成合成图像弥合图像-文本模态差距,提升以文本为中心的大型视觉-语言模型训练效果。