Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models
对抗性诗歌作为大型语言模型中的通用单轮绕过机制
机构 * DEXAI – Icaro Lab(DEXAI–Icaro实验室) ; Sapienza University of Rome(罗马Sapienza大学) ; Sant’Anna School of Advanced Studies(Sant’Anna高级研究学校) ; VU Amsterdam(阿姆斯特丹VU)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 对抗性诗歌被证明能有效绕过大型语言模型的安全机制,其攻击成功率显著高于传统方法,揭示了现有安全措施的局限性。