OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries
OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现
机构 * OpenAI
AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。
Comments 13 pages, two graphs