Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
重新思考用于大视觉语言模型胸部X光推理中的视觉归因
机构 * University of Virginia(弗吉尼亚大学) ; National Institutes of Health(美国国立卫生研究院)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文针对大视觉语言模型在胸部X光推理中视觉归因的可靠性问题,提出了一种因果评估框架,通过反事实编辑保留仅由专家标注区域验证的X光-VQA样本,以确定模型预测的因果责任区域。通过11种归因方法、6种开源LVLMs和两种输出模式,发现现有归因方法往往无法识别LVLMs所使用的证据。为此,本文提出MedFocus,一种基于概念的归因方法,通过不平衡最优传输局部化具有临床意义的解剖区域,并通过针对性干预测量其对模型输出的因果效应,显著优于现有方法,推动医疗LVLMs的更可信归因。