arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1730 篇

2507.21540 2026-04-09 cs.CR cs.CV 75%

PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking

PRISM:基于图像序列操作的程序化推理用于LVLM劫持

Quanchen Zou, Zonghao Ying, Moyang Chen, Wenzhuo Xu, Yisong Xiao, Yakai Li, Deyue Zhang, Dongdong Yang, Zhao Liu, Xiangzheng Zhang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本文提出PRISM框架,通过分解有害指令为多个无害视觉组件,利用模型推理过程生成有害输出,有效提升LVLM劫持成功率。

Comments This version is withdrawn to consolidate the submission under the corresponding author's primary account. The most recent and maintained version of this work can be found at arXiv:2603.09246

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17277 2026-03-10 cs.CR 75%

PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs

PolyJailbreak: 对黑盒多模态大语言模型的跨模态劫持攻击

Xinkai Wang, Beibei Li, Zerui Shao, Ao Liu, Guangquan Xu, Shouling Ji

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 PolyJailbreak通过多模态安全性不对称现象,提出结构化原子策略原语库,实现对黑盒多模态大语言模型的高效劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21190 2026-02-19 cs.CR 75%

The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning

恶意示例:通过模板填充和不安全推理实现大语言模型的劫持

Mingrui Liu, Sixiao Zhang, Cheng Long, Kwok Yan Lam

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 TrojFill通过模板填充和不安全推理漏洞,实现对大语言模型的安全过滤绕过,展示了对齐LLM的系统性弱点。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08741 2026-02-10 cs.CR 75%

Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing

大语言模型的脑部手术:通过专家沉默进行混合专家模型的劫持

Jona te Lintelo, Lichao Wu, Stjepan Picek

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 通过专家沉默技术,L$^3$攻击显著提高了MoE LLMs的劫持成功率,揭示了效率与安全之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04531 2026-02-03 cs.CL cs.AI cs.LG 75%

DP-Fusion: Token-Level Differentially Private Inference for Large Language Models

DP-Fusion: 令牌级差分隐私推理用于大语言模型

Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·泽亚德人工智能大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DP-Fusion通过令牌级差分隐私机制,在保证隐私的同时提升大语言模型的文本质量。

Comments Code: https://github.com/rushil-thareja/dp-fusion-lib | PyPI: https://pypi.org/project/dp-fusion-lib/ | Demo: https://www.documentprivacy.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02376 2025-12-23 cs.CL cs.AI cs.CR cs.LG 75%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:面向大语言模型多轮对抗性提示的自动化 jailbreaking

Aashray Reddy, Andrew Zagula, Nicholas Saban

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AutoAdv通过多轮自适应机制实现高成功率的对抗性提示攻击,揭示当前安全机制在多轮对话中的脆弱性。

Comments Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05853 2025-12-09 cs.CV 75%

VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack

通过视觉推理序列攻击对多模态大语言模型进行劫持

Shiji Zhao, Shukun Xiong, Yao Huang, Yan Jin, Zhenyu Wu, Jiyang Guan, Ranjie Duan, Jialing Tao, Hui Xue, Xingxing Wei

机构 * Alibaba Group(阿里巴巴集团) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 VRSA通过视觉推理序列攻击方法,针对多模态大语言模型的视觉模态进行劫持,提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03771 2025-12-05 cs.CL cs.AI cs.CR cs.LG 75%

In-Context Representation Hijacking

上下文表示劫持

Itay Yona, Amir Sarid, Michael Karasik, Yossi Gandelsman

机构 * Mentaleap Independent Researcher(独立研究者) UC Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Doublespeak通过替换有害关键词为无害标记,使模型内部表示收敛至有害语义,从而绕过安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08367 2025-11-12 cs.CR 75%

Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs

Yuxuan Zhou, Yuzhao Peng, Yang Bai, Kuofeng Gao, Yihao Zhang, Yechao Zhang, Xun Chen, Tao Yu, Tao Dai, Shu-Tao Xia

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08604 2025-10-31 cs.CL cs.AI cs.LG 75%

LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback

Raffaele Mura, Giorgio Piras, Kamilė Lukošiūtė, Maura Pintor, Amin Karbasi, Battista Biggio

机构 * University of Cagliari(卡利亚里大学) Centre for AI Governance(人工智能治理中心) Foundation AI – Cisco Systems Inc.(AI基金会——思科系统公司)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20223 2025-10-24 cs.CR cs.MM 75%

Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations

Divyanshu Kumar, Shreyas Jena, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi

专题命中 越狱攻击 :alignment(abstract);safety(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21401 2025-10-24 cs.CV 75%

JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation

Md Jueal Mia, M. Hadi Amini

机构 * Knight Foundation School of Computing and Information Sciences (KFSCIS)(骑士基金会计算与信息科学学院) Florida International University(佛罗里达国际大学) Sustainability, Optimization, and Learning for InterDependent networks laboratory (solid lab)(可持续性、优化与互依赖网络学习实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01644 2025-10-13 cs.CL cs.AI cs.CY 75%

Machine Learning for Detection and Analysis of Novel LLM Jailbreaks

John Hawkins, Aditya Pramar, Rodney Beard, Rohitash Chandra

机构 * Centre for Artificial Intelligence and Innovation(人工智能与创新中心) Pingla Institute(平拉研究所) Transitional Artificial Intelligence Research Group(过渡人工智能研究组) UNSW(新南威尔士大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12221 2025-09-17 cs.LG cs.AI cs.CL cs.CR 75%

MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors

Xin Tong, Zhi Lin, Jingya Wang, Meng Han, Bo Jin

机构 * Xin Tong School of Information and Cyber Security People’s Public Security University of China(信息与网络安全学院 中国人民公安大学) Zhi Lin School of Safety Science Tsinghua University(安全科学学院 清华大学) Jingya Wang School of Information and Cyber Security People’s Public Security University of China(信息与网络安全学院 中国人民公安大学) Meng Han Intelligent Fusion Research Center Zhejiang University(智能融合研究中心 浙江大学) Bo Jin* The Third Research Institute of the Ministry of Public Security of China(中华人民共和国公安部第三研究所)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10807 2025-06-13 cs.CR 75%

Towards Action Hijacking of Large Language Model-based Agent

Yuyang Zhang, Kangjie Chen, Jiaxin Gao, Ronghao Cui, Run Wang, Lina Wang, Tianwei Zhang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02174 2025-06-09 cs.CL cs.AI cs.LG 75%

Adversarial Tokenization

Renato Lui Geh, Zilei Shao, Guy Van den Broeck

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20823 2025-03-28 cs.CR 75%

Playing the Fool: Jailbreaking LLMs and Multimodal LLMs with Out-of-Distribution Strategy

Joonhyun Jeong, Seyun Bae, Yeonsung Jung, Jaeryong Hwang, Eunho Yang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

Comments Accepted at CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18000 2024-12-02 cs.CV 75%

Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models

Shuyang Hao, Bryan Hooi, Jun Liu, Kai-Wei Chang, Zi Huang, Yujun Cai

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11445 2024-11-06 cs.CR cs.AI cs.CL cs.LG 75%

Jailbreaking Large Language Models with Symbolic Mathematics

Emet Bethany, Mazal Bethany, Juan Arturo Nolazco Flores, Sumit Kumar Jha, Peyman Najafirad

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19160 2024-10-28 cs.LG cs.AI cs.CL cs.CR 75%

Adversarial Attacks on Large Language Models Using Regularized Relaxation

Samuel Jacob Chacko, Sajib Biswas, Chashi Mahiul Islam, Fatema Tabassum Liza, Xiuwen Liu

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01420 2024-08-05 cs.LG cs.AI cs.CL 75%

Mission Impossible: A Statistical Perspective on Jailbreaking LLMs

Jingtong Su, Julia Kempe, Karen Ullrich

专题命中 越狱攻击 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07403 2024-07-15 cs.CV 75%

A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends

Daizong Liu, Mingyu Yang, Xiaoye Qu, Pan Zhou, Yu Cheng, Wei Hu

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08679 2024-06-10 cs.LG cs.AI cs.CL 75%

COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability

Xingang Guo, Fangxu Yu, Huan Zhang, Lianhui Qin, Bin Hu

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23075 2026-06-23 cs.CR cs.AI 新提交 74%

Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies

自进化LLM智能体系统中的安全性:威胁、放大与案例研究

Ruixiao Lin, Xinhao Deng, Qingming Li, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhenyuan Li, Yechao Zhang, Shiwen Cui, Changhua Meng, Tianwei Zhang, Xingjun Ma, Qi Li, Ke Xu, Shouling Ji

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Hangzhou Dianzi University(杭州电子科技大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学)

专题命中 越狱攻击 :safety(title);分类 cs.AI

AI总结 本文系统分析自进化LLM智能体系统的安全威胁,提出模块-生命周期攻击面矩阵,揭示17个关键威胁和7种跨模块放大效应,并通过案例证明进化设计激活3.5倍攻击面且静态防御失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21077 2026-06-23 cs.CR cs.CL 新提交 74%

OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

OTTER:一种用于规避毒性检测的越狱提示优化的红队系统

Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai, Nai-Chia Chen, Fang Yu

机构 * National Chengchi University, Taipei, Taiwan(国立中正大学,台北,台湾) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :jailbreak(title);分类 cs.CL

AI总结 提出OTTER系统,通过替换少量令牌解耦表面毒性与对抗意图,在四个GPT模型上将平均攻击成功率从7.0%提升至84.0%,并首次量化分析毒性-绕过关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05379 2025-10-09 cs.CR cs.AI 74%

AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling

Xiaogeng Liu, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 越狱攻击 :jailbreak(title);分类 cs.AI

Comments Technical report. Code is available at https://github.com/SaFoLab-WISC/AutoDAN-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13662 2025-01-29 cs.CL 74%

Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings

Yue Huang, Jingyu Tang, Dongping Chen, Bingda Tang, Yao Wan, Lichao Sun, Philip S. Yu, Xiangliang Zhang

专题命中 越狱攻击 :alignment(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07725 2024-10-11 cs.LG cs.NE 74%

Towards Trustworthy Web Attack Detection: An Uncertainty-Aware Ensemble Deep Kernel Learning Model

Yonghang Zhou, Hongyi Zhu, Yidong Chai, Yuanchun Jiang, Yezheng Liu

专题命中 越狱攻击 :trustworthy(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16727 2024-09-26 cs.CL 74%

RoleBreak: Character Hallucination as a Jailbreak Attack in Role-Playing Systems

Yihong Tang, Bo Wang, Xu Wang, Dongming Zhao, Jing Liu, Jijun Zhang, Ruifang He, Yuexian Hou

专题命中 越狱攻击 :jailbreak(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16192 2024-03-01 cs.CL 74%

Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing

Jiabao Ji, Bairu Hou, Alexander Robey, George J. Pappas, Hamed Hassani, Yang Zhang, Eric Wong, Shiyu Chang

专题命中 越狱攻击 :jailbreak(title);分类 cs.CL

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏