Unraveling LLM Jailbreaks Through Safety Knowledge Neurons
通过安全知识神经元揭开大语言模型劫持的面纱
机构 * Duke Kunshan University(杜克昆山大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出SafeTuning方法,通过调整安全知识神经元激活来提升大语言模型对劫持攻击的防御能力,实验显示其在多个模型上均有效
Comments EACL 2026