arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Google DeepMind发表ResidencyRL,临床AI在模拟问诊中获87.6%医生偏好

arXiv 2608.07418 cs.AI · cs.CL

医疗AI在一道选择题上答对,不代表它能完成一次真正的接诊。Google DeepMind联合多家医院提出ResidencyRL,让模型在最长60轮对话、最多8次工具调用的模拟门诊中练习问诊、检查、诊断、治疗和记录。在97个病例的医生盲评中,经过训练的智能体获得87.6%的整体偏好。

从答题转向完整照护流程

现实临床决策是连续的:医生先收集主诉和病史,再决定检查,依据新结果调整判断,还要向患者解释风险并留下文书。模型若过早下结论,可能漏掉危险信号;若无节制调用检查,又会制造成本和不必要干预。单轮医学问答很难覆盖这些取舍。

ResidencyRL把训练环境设计成“模拟住院医轮转”。场景生成器提出常规、复杂和对抗性病例,患者模拟器只在被恰当询问时透露相应信息。智能体可以进行多轮沟通和工具调用,最终不仅要给出诊断,还需提交管理方案、随访安排和临床记录。

ResidencyRL中的模拟患者病例

病例信息分阶段出现,模型必须主动追问,而不是一次看到完整标准答案。

奖励不只看诊断名称

系统为每条轨迹设置结构化评分,覆盖诊断准确性、管理方案、病史采集、沟通、文书和安全性。训练采用群组相对策略优化,让同一场景中的多种处置相互比较。生成场景还经过“提出者—评判者”流程筛选,避免模型只记住固定题库的表述。

这一设计的重点是延迟反馈:前几轮选择的问题,会影响后面能否发现关键信息;工具调用看似局部正确,也可能把整条诊疗路径带偏。强化学习因此优化的是完整轨迹,而非单个医学事实。论文展示的肿瘤和远程医疗案例中,模型需要结合症状变化、既往史与检查结果逐步收窄判断。

模型在肿瘤场景中的多阶段处置过程

长程训练要求模型把检查结果重新纳入后续决策,而不是机械重复最初计划。

对抗场景提升7个百分点

在包含误导信息或异常表现的对抗性病例中,ResidencyRL的诊断表现由81%提高到88%,提升7个百分点;漏掉关键危险信号的情况减少31%。这些数字说明,收益并非只来自在简单病例上写出更完整的回答,而是体现在信息不充分、需要继续追问的场景。

医生对97个病例进行成对盲评时,87.6%的总体比较偏好ResidencyRL版本;完整性偏好达到90.7%,管理质量偏好为75.3%。团队还在AMIE多轮诊疗框架的六个维度及其他医学评测上观察到方向一致的改进。

完整性与管理质量之间的差距值得注意。模型更容易学会多问问题、写出覆盖面更广的记录,但从更多信息中选出恰当治疗方案仍然更难。换言之,强化学习首先改善了流程纪律,并没有把所有临床判断同时推到同一水平。对实际系统评估,也应把信息收集、诊断、处置和安全分别报告,而不能用一个总体偏好分数代替。

临床医生对两种智能体回答的偏好统计

偏好评测覆盖整体质量、完整性与管理方案,但它仍属于模拟病例中的专家判断。

从模拟训练走向临床辅助应用

ResidencyRL首先适合用于临床AI的训练与压力测试:在不接触真实患者的环境中,批量生成复杂病例,检查模型是否主动追问危险信号、合理使用工具并完成结构化记录。医院也可以围绕本地流程构造专科场景,提前发现单轮医学考试覆盖不到的工作流问题。

论文中的患者、工具反馈和部分评判来自模拟系统,97例医生偏好不能替代真实患者结局。下一步仍需由医生主导开展前瞻性评估,分别验证诊断、处置、安全和文书质量,并持续记录模型建议被采纳、修改或否决的原因。

如果这些评估能够建立稳定边界,ResidencyRL的长程训练方式可以先进入医生辅助、病例演练和质量审核,而不是让模型直接承担独立接诊。虚拟教学医院由此成为临床部署前的一层可重复验证环境。

参考资料

https://arxiv.org/abs/2608.07418