The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs
面具背后的魔鬼:扩散语言模型的新兴安全漏洞
机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; University of Chicago(芝加哥大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL
AI总结 DIJA揭示了扩散语言模型的安全漏洞,通过构造对抗性提示利用双向建模和并行解码机制,使有害内容在对齐训练模型中得以生成。
Comments Accepted by ICLR 2026