Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy
压力测试医学大语言模型揭示基准准确性之外的潜在安全病理
机构 * College of Computer Science and Technology, Zhejiang University, PR China(浙江大学计算机科学与技术学院,中国)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出AI-MASLD压力审计框架,通过240个临床病例和六种叙事扰动探针对七种模型进行双重压力测试,发现量化模型存在伪正常化,医学监督微调损害逻辑稳定性和公平性,开源模型在安全维度上达到或超越闭源模型。
Comments 34 pages, 5 figures