发表机构
Baruch College; University of North Carolina at Chapel Hill; Tsinghua University; New York University; Zhongshan Hospital (Xiamen), Fudan University(巴鲁克学院; 北卡罗来纳大学教堂山分校; 清华大学; 纽约大学; 复旦大学附属中山医院(厦门))
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
TrustMed-RL利用临床适配的GiGPO和覆盖调整奖励,训练80亿参数视觉语言模型,在长时程循证诊断中达到37.1%准确率,显著超越基线并获医生高度认可。
AI 中文摘要
医疗语言模型即使在不完整的检查和缺乏依据的推理下也能产生正确的诊断。为了支持长时程、基于证据的诊断,我们引入了TrustMed-RL。该模型基于PubMed罕见病病例和超过24,000个手动标注的图像面板构建,通过状态依赖的动作整合了问诊、检查、检验、专科会诊和文献检索。我们的80亿参数视觉-语言策略,采用临床适配的GiGPO和覆盖调整的诊断奖励进行训练,在2,500个评估病例上达到了37.1%的诊断准确率,优于所有评估的开权重基线,并比监督微调提高了12.4个百分点。当成功还要求获取至少50%的支持性检验证据时,TrustMed-RL达到了32.5%,超过GPT-4o 6.8个百分点。此外,它在MTMedDialog上超越了所有评估的基线,并在AgentClinic上超越了多个更大的27-32B模型。在医生对200条诊断被接受的测试集轨迹的审查中,83.0%获得了4-5分(满分5分)的证据依据评分。医生的评估表明,这些诊断轨迹是可信的,并且与人类诊断推理一致。
英文摘要
Medical language models can produce correct diagnoses despite incomplete investigations and unsupported reasoning. To support long-horizon, evidence-grounded diagnosis, we introduce \textbf{TrustMed-RL}. Built from PubMed rare-disease cases and over 24,000 manually annotated image panels, it integrates interviews, examinations, testing, specialist consultation, and literature search through state-dependent actions. Our 8B vision--language policy, trained with clinically adapted GiGPO and coverage-adjusted diagnostic rewards, achieves 37.1\% diagnostic accuracy on 2,500 evaluation cases, outperforming all evaluated open-weight baselines and improving over supervised fine-tuning by 12.4 percentage points.. When success additionally requires acquiring at least 50\% of supporting test evidence, TrustMed-RL achieves 32.5\%, exceeding GPT-4o by 6.8 percentage points. Furthermore, it surpasses all evaluated baselines on MTMedDialog and multiple larger 27--32B models on AgentClinic. In physician review of 200 diagnostically accepted test-set trajectories, 83.0\% receive evidential-grounding scores of 4--5 out of 5. Physicians' assessments suggest that these diagnostic trajectories are trustworthy and aligned with human diagnostic reasoning.