CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) ; Zhongguancun Academy, Beijing, China(中关村学院)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.AI
Comments Accepted to ACL 2025 (Findings), camera-ready version