A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
A2D: 任意顺序、任意步长的安全对齐用于扩散语言模型
机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) ; Department of Computer Science and Engineering, Yonsei University(计算机科学与工程系,延世大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 A2D通过令牌级对齐方法,在扩散语言模型中实现任意顺序和步长攻击的鲁棒防御,显著降低有害输出生成概率并提升安全终止效率。
Comments Accepted at ICLR 2026. Code and models are available at https://ai-isl.github.io/A2D