Self-HarmLLM: Can Large Language Model Harm Itself?
机构 * Soongsil University(首尔大学)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Soongsil University(首尔大学)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI