arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

MedFailBench:用于医学人工智能安全边界检查的临床医生构建的开源基准测试

MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection

Goktug Ozkan

arXiv 2607.15166首次发表:更新:

发表机构

Kutahya Emet Dr. Fazil Dogan State Hospital(屈塔希亚埃梅特法齐尔·多安州立医院)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

MedFailBench提出不同问题,构建合成基准测试和失败图谱,通过严重程度和安全门类型标记医学人工智能错误,当前版本含44个合成病例等内容,以特定许可形式发布并带有DOI。

AI 中文摘要

大多数医学人工智能基准测试衡量模型是否知道正确答案。MedFailBench提出了一个不同的问题:哪个安全边界失败了?我们展示了一个由临床医生构建的合成基准测试和失败图谱,它通过严重程度(1 - 5)和安全门类型(错过紧急升级、不安全远程给药、不安全出院保证、证据伪造、不安全协议执行、源支持差距)对医学人工智能错误进行标记。当前公开发布版本(v0.2.1)包含44个经临床医生审核的带有严重程度注释的合成病例、实时的HuggingFace排行榜预览、安全门分类法、临床严重程度评分标准以及用于存档模型响应筛选运行的自动化管道。不包括患者数据、临床验证声明或模型排名。MedFailBench根据Apache - 2.0和CC - BY - 4形式发布,并带有Zenodo DOI https://doi.org/10.5281/zenodo.21205535。

英文摘要

Most medical AI benchmarks measure whether a model knows the correct answer. MedFailBench asks a different question: which safety boundary failed? We present a synthetic benchmark and failure atlas built by a clinician. The resource labels medical AI errors by severity from 1 to 5 and safety gate type: missed urgent escalation, unsafe remote dosing, unsafe discharge reassurance, evidence fabrication, unsafe protocol execution, and source support gap. The current public release (v0.2.1) contains 44 synthetic cases reviewed by a clinician, with severity annotations, a public Hugging Face Space source, a safety gate taxonomy, a clinical severity rubric, and an automated pipeline for archiving model response screening runs. Forty cases have a populated safety gate field, and four require gate completion. No patient data, clinical validation claims, or model rankings are included. MedFailBench is released under Apache-2.0 and CC-BY-4.0 and carries the Zenodo DOI 10.5281/zenodo.21205535.

Comments6 pages; synthetic benchmark reviewed by a clinician; no patient data

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑