BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
BiasJailbreak: 分析大型语言模型中的伦理偏见和 jailbreak 漏洞
机构 * Theori Inc.(Theori公司)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究分析了大型语言模型中的伦理偏见和 jailbreak 漏洞,提出 BiasJailbreak 和 BiasDefense 方法以提高模型安全性。
Comments Accepted as a workshop paper at AAAI 2026