Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
通过解码过程中的安全意识探测防御大型语言模型的劫持攻击
机构 * Northeastern University, China(东北大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 通过在解码过程中激活内在安全意识,提升大型语言模型对劫持攻击的防御能力。