Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode
扩散模型更安全,但受上下文影响而失效:扩散大语言模型的安全祝福及其失效模式
Zeyuan He, Yupeng Chen, Lang Lin, Yihan Wang, Shenxu Chang, Eric Sommerlade, Philip Torr, Junchi Yu, Adel Bibi, Jialin Yu
机构
*
Torr Vision Group, University of Oxford(牛津大学Torr视觉组)
;
School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)
;
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Microsoft(微软)
机构
*
Nanyang Technological University(南洋理工大学)
;
BraneMatrix AI
;
Nanjing University of Science and Technology(南京理工大学)
;
Northeast University(东北大学)
;
Renmin University of China(中国人民大学)
;
Alibaba Group(阿里巴巴集团)
;
Beihang University(北航)
;
National University of Singapore(新加坡国立大学)
;
Zhejiang Lab(浙江实验室)
CommentsICLR 2026 Poster The source code relevant to this article has now been open-sourced; for details, please visit: https://github.com/xunhuang123/CC-BOS
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
结构化语义遮蔽用于大型语言模型的对抗攻击
Xiaobing Sun, Perry Lam, Shaohua Li, Zizhou Wang, Rick Siow Mong Goh, Yong Liu, Liangli Zhen
机构
*
Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡)
;
Information Systems Technology and Design Pillar, Singapore University of Technology and Design(信息技术与设计支柱,新加坡科技设计大学)
Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT
隐形微调:通过自动生成的CoT打破RVLMs的对齐
Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu
机构
*
Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室)
;
University of Wisconsin--Madison(威斯康星大学麦迪逊分校)
;
Department of Automation, Tsinghua University(清华大学自动化系)
;
Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)
机构
*
Zhejiang University(浙江大学)
;
Nanjing University of Posts and Telecommunications(南京邮电大学)
;
Northwestern University(西北大学)
;
Sun Yat-sen University(中山大学)
CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation
CEE: 通过子空间概念旋转实现体智能中的推断时间劫持防御
Jirui Yang, Zheyu Lin, Zhihui Lu, Yinggui Wang, Lei Wang, Tao Wei, Qiang Duan, Xin Du, Shuhan Yang
机构
*
Fudan University(复旦大学)
;
Dalian University of Technology(大连理工大学)
;
Ant Group(蚂蚁集团)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
Zhejiang University(浙江大学)
Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks
出血路径:LLM隐藏状态中的判别能力消失加剧了 jailbreak 攻击
Yingjie Zhang, Tong Liu, Zhe Zhao, Guozhu Meng, Kai Chen
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
Ant Group(蚂蚁集团)
ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models
Weifei Jin, Yuxin Cao, Junjie Su, Minhui Xue, Jie Hao, Ke Xu, Jin Song Dong, Derui Wang
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
National University of Singapore(新加坡国立大学)
;
CSIRO’s Data61(CSIRO数据61)
;
Responsible AI Research (RAIR) Centre, The University of Adelaide(负责任人工智能研究(RAIR)中心,阿德莱德大学)
;
Tsinghua University(清华大学)
AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning
Zhenyu Pan, Yiting Zhang, Zhuo Liu, Yolo Yunlong Tang, Zeliang Zhang, Haozheng Luo, Yuwei Han, Jianshu Zhang, Dennis Wu, Hong-Yu Chen, Haoran Lu, Haoyang Fang, Manling Li, Chenliang Xu, Philip S. Yu, Han Liu
机构
*
Northwestern University(西北大学)
;
University of Illinois at Chicago(伊利诺伊大学香槟分校)
;
University of Rochester(罗切斯特大学)
;
Carnegie Mellon University(卡内基梅隆大学)