Do Methods to Jailbreak and Defend LLMs Generalize Across Languages?
机构 * Penn State University(宾夕法尼亚州立大学) ; Information Sciences Institute, USC(信息科学研究所)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Penn State University(宾夕法尼亚州立大学) ; Information Sciences Institute, USC(信息科学研究所)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :safety(abstract);分类 cs.AI