Toward Revealing Nuanced Biases in Medical LLMs
向揭示医疗大语言模型中的细微偏见迈进
机构 * University of Delaware(特拉华大学)
专题命中 红队测试 :red teaming(abstract);分类 cs.AI
AI总结 本文提出结合知识图谱与辅助LLMs的框架,通过对抗性扰动和多跳表征技术,系统揭示医疗大语言模型中的复杂偏见模式。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
向揭示医疗大语言模型中的细微偏见迈进
机构 * University of Delaware(特拉华大学)
专题命中 红队测试 :red teaming(abstract);分类 cs.AI
AI总结 本文提出结合知识图谱与辅助LLMs的框架,通过对抗性扰动和多跳表征技术,系统揭示医疗大语言模型中的复杂偏见模式。