MLB: A Scenario-Driven Benchmark for Evaluating Large Language Models in Clinical Applications
MLB:面向临床应用的大型语言模型评估场景驱动基准
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Health Information Center of Zhejiang Province(浙江省健康信息中心) ; Peking University(北京大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)
AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。
Comments 11 pages, 4 figures, 5 tables