arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

North American Chapter of the Association for Computational Linguistics · 会议 · Natural Language Processing

2025-11-21 至 2025-11-21 共收录 1
2503.12339 2025-11-21 cs.LG cs.AI

A Closer Look at Adversarial Suffix Learning for Jailbreaking LLMs: Augmented Adversarial Trigger Learning

深入研究对抗后缀学习用于劫持大语言模型:增强的对抗触发学习

Zhe Wang, Yanjun Qi

机构 * University of Virginia(弗吉尼亚大学)

AI总结 ATLA通过增强的对抗触发学习方法,高效生成劫持大语言模型的后缀并提取隐藏系统提示,实现高成功率和低查询消耗。

Comments the Association for Computational Linguistics: NAACL 2025

Journal ref https://aclanthology.org/2025.findings-naacl.394/

详情

展开后加载摘要…

URL PDF HTML 收藏