Beyond CLIP: Knowledge-Enhanced Multimodal Transformers for Cross-Modal Alignment in Diabetic Retinopathy Diagnosis
超越CLIP:基于知识的多模态Transformer用于糖尿病视网膜病变诊断中的跨模态对齐
机构 * Department of Medicine Stanford University Stanford, USA(医学系 斯坦福大学)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种基于知识的多模态Transformer框架,通过整合视网膜图像、临床文本和结构化数据,提升糖尿病视网膜病变诊断中的跨模态对齐与检索性能。
Comments 14 pages, 14 figures