A Women's Health Benchmark for Large Language Models
为大型语言模型建立女性健康基准
机构 * Lumos AI ; Medical Oncology, Yale Cancer Center(耶鲁癌症中心医学肿瘤学部) ; Obstetrics and Gynecology, MGH, Harvard Medical School(妇产科,MGH,哈佛医学院) ; Obstetrics, Gynecology & Reproductive Sciences, UCSF(妇产科与生殖科学,UCSF) ; Brown Division of Global Emergency Medicine(全球急诊医学部,布朗分部) ; Department of Emergency Medicine, Emory University(急诊医学部,埃默里大学) ; Pharmacy Department, Clinic Ottakring(药学部,克利克诊所) ; Windrush Surgery, Buckinghamshire, Oxfordshire and Berkshire West Integrated Care Board, NHS(温德许手术,贝肯ham郡,牛津郡和伯克希尔西部整合护理委员会,NHS) ; Women’s Health Research, Yale School of Medicine(女性健康研究,耶鲁医学院) ; Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出女性健康基准,评估LLM在女性健康领域的表现,发现现有模型在关键任务上存在显著缺陷,需进一步改进以提供可靠医疗建议。
Comments 15 pages, 6 Figures, 2 Tables