arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Google DeepMind让AMIE视频问诊:100个模拟病例中多项能力追平或超过医生

arXiv 2608.09861 cs.AI · cs.CL · cs.CV

Google Research和Google DeepMind把医疗对话系统AMIE扩展到实时视频问诊。新系统能在交谈时分析声音和画面,记录动作、表情与身体观察,再将这些信息纳入诊断和处置。

团队用30名全科医生、15名专业患者演员和100个标准化临床场景做随机OSCE评测。临床评审认为,AMIE视频版在病史采集、诊断、管理和身体观察等项目上与医生相当或更好。

三个Agent分担交谈、观察和临床推理

AMIE视频版基于Gemini,但不用单个模型从头做到尾。Talker Agent直接面向患者,负责低延迟对话;Perception Agent持续查找与临床有关的视听线索,并保留累积观察;Planner Agent维护病史、鉴别诊断和下一步计划。

这种异步分工是为了同时处理两个冲突的要求:视频交谈不能每句都长时间停顿,临床推理又需要综合前面的信息。Talker从另外两个Agent读取最新状态,不必等全部分析完成才开口。

AMIE视频问诊的三Agent系统架构

Talker、Perception和Planner分别处理实时交谈、视听观察和临床计划。

100个场景按真实问诊流程对比

每个场景都由患者演员按病例包表演,分别与AMIE视频版、AMIE文字版或医生完成问诊。交谈结束后,系统和医生都要填写临床推理问卷,独立评审再根据通用OSCE标准和病例专用量表打分。

AMIE视频版、文字版与全科医生的随机OSCE设计

评测将问诊交互、事后临床推理和患者体验分开评价。

患者演员更偏好AMIE在评估病情和解释状况时的做法,但在建立关系和合作感方面更偏好真人医生。对照AMIE自身的文字版时,演员认为视频界面在沟通效果、便利性和“被理解”上更好。

从聊天框走向可观察的视频问诊

与纯文字医疗AI相比,视频系统可以请对方转头、抬手或展示局部,再把观察写入临床状态。论文示例中,Perception Agent根据画面记录手臂活动范围和动作对称性,Planner则结合病史更新鉴别诊断。

AMIE在视频交谈中记录动作并更新临床状态

示例界面同时呈现患者对话、视觉观察和计划更新。

这也带来更严格的能力边界。作者报告系统对精细解剖位置、微妙情绪线索和高频动作的处理仍不足。所有结果来自标准化演员参与的模拟OSCE,不是实际诊疗或患者疗效证据。

团队还专门建立了临床视听能力分类,将线索按人体观察、动作、声音和交互等类型组织,然后用多轮模拟对话来测试Perception Agent是否在正确时机记录正确线索。这套评估不只检查最终诊断,还可以定位视觉观察是否遗漏、描述错误或没有被Planner使用。

模态消融将AMIE视频版与文字版放在相同类型病例上。视频界面的收益不只是多了一路画面,而是患者可以直接展示动作和局部情况,系统也可以追问并要求换一个角度。演员对沟通效率、使用便利和被理解感的偏好,都是在这种完整交互中评出的。

在医生与AI对比中,评审将病史采集、鉴别诊断、管理建议、观察和检查分开打分,避免用一个总体印象掩盖某个具体环节。患者演员的另一套量表则聚焦解释、关切、共情、建立关系和合作,这才显示出AI与医生各自占优的部分。

下一步走向真实临床辅助验证

系统的三Agent状态更新也为人机协作留出了可观察接口:医生可以分别查看AI听到的病史、从画面提取的线索和当前计划,而不是只收到一个最终诊断。这种分层记录在真实医疗审核中比单一对话文本更容易定位错误来源。

团队为远程医疗的视听线索建立了能力分类和自动评测,这比单纯比较诊断答案多了一层工程基础。后续验证需要纳入真实患者、更复杂病程、隐私与安全流程,并观察AI如何与医生协作,而不只是在模拟考试中与医生对比。

AMIE视频问诊在诊断、管理和患者偏好上的评测

评测展示了AMIE视频版与医生的多维度比较,人际关系类指标仍是医生更强。

参考资料

https://arxiv.org/abs/2608.09861