Beyond CLIP: Knowledge-Enhanced Multimodal Transformers for Cross-Modal Alignment in Diabetic Retinopathy Diagnosis
超越CLIP:基于知识的多模态Transformer用于糖尿病视网膜病变诊断中的跨模态对齐
机构 * Department of Medicine Stanford University Stanford, USA(医学系 斯坦福大学)
专题命中 医疗多模态 :diagnosis(title);medical image(abstract);分类 cs.CV
AI总结 本文提出一种基于知识的多模态Transformer框架,通过整合视网膜图像、临床文本和结构化数据,提升糖尿病视网膜病变诊断中的跨模态对齐与检索性能。
Comments 14 pages, 14 figures