AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
AISA: 在大型语言模型中唤醒对抗劫持攻击的内在安全性意识
机构 * Beijing University of Technology(北京理工大学) ; Macau University of Science and Technology(澳门科技大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.AI
AI总结 AISA通过激活模型内在安全机制,提供一种轻量级、单次通过的防御方法,有效提升大型语言模型对抗劫持攻击的鲁棒性与安全性。