Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning
通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理
机构 * University of Adelaide(阿德莱德大学) ; Hohai University(河海大学) ; Amap
专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.LG
AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。