arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-11 至 2026-02-11 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1 篇

2507.11097 2026-02-11 cs.CL 85%

The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs

面具背后的魔鬼:扩散语言模型的新兴安全漏洞

Zichen Wen, Jiashu Qu, Zhaorun Chen, Xiaoya Lu, Dongrui Liu, Zhiyuan Liu, Ruixi Wu, Yicun Yang, Xiangqi Jin, Haoyun Xu, Xuyang Liu, Weijia Li, Chaochao Lu, Jing Shao, Conghui He, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Chicago(芝加哥大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 DIJA揭示了扩散语言模型的安全漏洞,通过构造对抗性提示利用双向建模和并行解码机制,使有害内容在对齐训练模型中得以生成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏