亚马逊Health AI团队用1200个模拟患者场景测试10款基础模型。表现最强的模型综合得分为4.25分,满分5分;分诊项目的最高通过率为88%,最弱模型只有32%。
所有测试均为研究配置,没有真实患者参与,也不代表相关模型已用于亚马逊医疗产品。论文关注的对象是能对话、读取模拟健康记录并调用工具的患者端智能体,而非常见的医学选择题模型。
论文图1:两种智能体面对同一患者与工具环境,可能在风险筛查和操作结果上产生明显差异。
1200个患者场景共产生1.2万段对话
PatientAgentBench让模拟患者与医疗智能体进行最多15轮交流。任务包括健康咨询、用药、寻找服务提供者和修改个人资料。智能体可以使用沙箱工具处理医疗流程,但不能直接作出最终诊断。
测试集覆盖79种疾病或组合病症,30%的案例为重症,约三分之二被设计为多病共存或多重用药等复杂情况。患者还会表现出焦虑、怀疑、沉默或困惑等不同交流方式。这个分布是人为加压设计,不能视为真实门诊病例比例。
10个模型来自Anthropic、OpenAI、Google和阿里巴巴四个模型家族。每个模型完成同一批1200个场景,共形成1.2万段对话。评测分为任务完成、临床安全、流程准确、分诊质量、临床帮助和对话质量六项。
论文图2:基准先生成患者案例,再运行多轮工具调用对话,最后由评审模型按六个维度打分。
明显急症容易识别,行政请求里的风险更容易漏掉
最强模型在任务完成和对话质量上普遍接近满分,差距主要出现在分诊。Claude Opus 4.8综合得分4.25,分诊通过率88%;GPT-5.5综合得分4.22,分诊通过率76%。几款较弱的开放权重模型在分诊上只有32%。
论文图5:任务完成率普遍较高,临床安全、分诊质量和流程准确性拉开主要差距。
模型通常能够处理明确急症。困难案例往往看起来只是行政请求:患者想换药房、改预约或更新资料,但病历里同时存在多种药物、症状恶化或自杀意念。部分智能体直接执行请求,没有先做简短的临床风险筛查。
心理危机识别也有层次差异。前沿模型在患者明确表达自杀想法时大多能提供危机资源,却可能漏掉上下文中的间接信号;中等模型会错过部分明确披露;较弱模型存在系统性遗漏。作者主张把危机资源和必要筛查做成固定安全机制,减少对模型临场推理的依赖。
最强模型仍在1%至3%的安全案例中失败
临床安全和流程准确性也没有满分。前沿模型的失败比例约为1%至3%,常见问题包括没有验证工具返回结果,以及紧急情况中遗漏危机联系方式。较弱模型还会捏造医生姓名、电话号码、预约确认,或者声称已经执行一个实际并未运行的工具操作。
团队后来把筛查和安全原则写进智能体运行框架,在不更换基础模型的情况下把综合得分提高0.21分,多项通过率接近99%。这一结果来自同一套模拟基准,说明外围规则能修补部分缺口,仍不构成真实部署证据。
自动评委经过医生对照,但仍有剩余偏差
全部对话由两个大模型组成的评审组打分。持证临床医生另外标注共享样本,大模型评审与医生在相差不超过1分时的一致率为79%至93%。临床安全项目的一致率最低,说明最敏感的判断仍有分歧。
论文图16:六个维度中,大模型评审与临床医生的评分多数落在相差1分以内。
研究限制很明确:患者资料和对话全部为合成数据;人格在一段对话中保持固定,无法复现真实患者情绪变化;模型排名依赖论文设定的权重和及格线;所有作者受雇于亚马逊。论文也明确表示,这套基准不是部署安全认证,分数不能替代临床监督或用于直接采购决策。
目前的数据适合回答“哪些失败模式应该优先修”,不能回答“哪款模型已经可以独立看病”。患者端医疗AI要进入实际流程,还要经过真实机构、真实工作流和持续版本监测,尤其需要验证低频危机事件是否会被稳定识别。