A Closer Look at Adversarial Suffix Learning for Jailbreaking LLMs: Augmented Adversarial Trigger Learning
深入研究对抗后缀学习用于劫持大语言模型:增强的对抗触发学习
机构 * University of Virginia(弗吉尼亚大学)
AI总结 ATLA通过增强的对抗触发学习方法,高效生成劫持大语言模型的后缀并提取隐藏系统提示,实现高成功率和低查询消耗。
Comments the Association for Computational Linguistics: NAACL 2025
Journal ref https://aclanthology.org/2025.findings-naacl.394/