TextSLIP:用于医学报告生成的文本自监督CLIP
TextSLIP: Text Self-Supervised CLIP for Medical Report Generation
浏览论文内容
中文总结 AI 辅助
研究针对现有CLIP方法在医学报告生成中语义监督不足问题,提出TextSLIP框架,通过模态内文本对比学习增强CLIP,经实验验证其在报告生成指标上有改进,表明文本级对比学习对改善医学视觉-文本对齐有潜力。
中文摘要 AI 辅助
自动化放射学报告生成对于提高报告一致性和临床工作流程很重要。虽然对比语言-图像预训练(CLIP)推动了医学视觉语言建模,但现有CLIP式方法对复杂报告生成可能仍提供不足的细粒度语义监督。标准CLIP主要优化跨模态对齐,未明确构建指导视觉表征学习的文本嵌入空间。为解决此限制,我们提出TextSLIP,一个通用的医学视觉-语言预训练框架,通过模态内文本对比学习增强CLIP。通过自监督增强文本对提高文本嵌入可辨别性,TextSLIP旨在为视觉编码器提供更细粒度的语言监督。作为初步验证,我们在一个由700万个脑MRI图像-文本对组成的精选数据集上对TextSLIP进行预训练,并在报告生成架构内微调预训练的视觉编码器。在与CLIP式基线的对照比较中,TextSLIP在报告生成指标上显示出持续改进。消融研究进一步表明文本侧自监督有助于观察到的收益。这些结果表明文本级对比学习是改善医学视觉-文本对齐的一个有前途的方向,而在更多医学领域进行更广泛的验证仍是重要的下一步。
英文摘要
Automating radiology report generation is important for improving reporting consistency and clinical workflows . While Contrastive Language--Image Pretraining (CLIP) has advanced medical vision language modeling, existing CLIP-style approaches may still provide insufficient fine-grained semantic supervision for complex report generation. Standard CLIP primarily optimizes cross-modal alignment, without explicitly structuring the textual embedding space that guides visual representation learning. To address this limitation, we propose TextSLIP, a general medical vision-language pretraining framework that augments CLIP with intra-modal text contrastive learning. By improving textual embedding discriminability through self-supervised augmented text pairs, TextSLIP is designed to provide finer-grained linguistic supervision to the visual encoder. As an initial validation, we pretrain TextSLIP on a curated dataset of 7 million brain MRI image-text pairs and fine-tune the pretrained visual encoder within a report generation architecture. In controlled comparisons with CLIP-style baselines, TextSLIP shows consistent improvements on report generation metrics. Ablation studies further suggest that text-side self-supervision contributes to the observed gains. These results indicate that text-level contrastive learning is a promising direction for improving medical visual-textual alignment, while broader validation across additional medical domains remains an important next step.