arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1730 篇

2510.00565 2026-02-18 cs.AI cs.LG 79%

Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability

迈向更安全的扩散语言模型:发现和缓解提示漏洞

Shojiro Yamabe, Jun Sakuma

机构 * Institute of Science Tokyo(东京科学研究所) RIKEN AIP(理化学研究所AIP)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文发现扩散语言模型存在因迭代去噪过程导致的提示漏洞,并提出针对性的安全对齐方法以缓解该问题。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06440 2026-02-09 cs.CL cs.AI cs.CR 79%

TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking

TrailBlazer: 基于历史的强化学习用于黑盒大语言模型劫持

Sung-Hoon Yoon, Ruizhi Qian, Minda Zhao, Weiyue Li, Mengyu Wang

机构 * Daegu Gyeongbuk Institute of Science and Technology(大邱庆 bun 科学技术研究院) Harvard University(哈佛大学) University of Southern California(南加州大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.CL、cs.AI

AI总结 TrailBlazer通过历史感知强化学习提升黑盒大语言模型劫持效率,实现更高效的攻击策略和更高的查询效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20168 2025-12-24 cs.CR cs.AI cs.LG 79%

Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography

奥德赛:通过双隐写术对集成多模态大语言模型系统的商业系统进行劫持

Songze Li, Jiameng Cheng, Yiming Li, Xiaojun Jia, Dacheng Tao

机构 * S3IC-Lab(S3IC实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 奥德赛通过双隐写术劫持多模态大语言模型集成系统,揭示现有安全过滤器的局限性,实现高达99%的攻击成功率。

Comments This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18469 2025-11-10 cs.CL cs.LG 79%

Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities

Chung-En Sun, Xiaodong Liu, Weiwei Yang, Tsui-Wei Weng, Hao Cheng, Aidan San, Michel Galley, Jianfeng Gao

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments Accepted to NAACL 2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21983 2025-10-28 cs.CL cs.AI 79%

Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks

Havva Alizadeh Noughabi, Julien Serbanescu, Fattane Zarrinkalam, Ali Dehghantanha

机构 * Cyber Science Lab, University of Guelph(圭尔夫大学网络安全实验室) College of Engineering, University of Guelph(圭尔夫大学工程学院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07192 2025-10-06 cs.CR cs.CL cs.LG 79%

PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips

Zachary Coalson, Jeonghyun Woo, Chris S. Lin, Joyce Qu, Yu Sun, Shiyang Chen, Lishan Yang, Gururaj Saileshwar, Prashant Nair, Bo Fang, Sanghyun Hong

机构 * Oregon State University(俄勒冈州立大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) George Mason University(乔治·梅森大学) Rutgers University(罗格斯大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21059 2025-09-23 cs.CV cs.AI cs.CR cs.LG 79%

FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts

Ziyi Zhang, Zhen Sun, Zongmin Zhang, Jihui Guo, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10404 2025-08-15 cs.CL cs.AI 79%

Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation

Huizhen Shu, Xuying Li, Qirui Wang, Yuji Kosuga, Mengqiu Tian, Zhuo Li

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06466 2025-07-10 cs.LG cs.AI 79%

Foundation Model Self-Play: Open-Ended Strategy Innovation via Foundation Models

Aaron Dharna, Cong Lu, Jeff Clune

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.AI、cs.LG

Comments 67 pages, accepted to RLC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09066 2025-07-08 cs.LG cs.AI cs.CR 79%

Probing Latent Subspaces in LLM for AI Security: Identifying and Manipulating Adversarial States

Xin Wei Chia, Swee Liang Wong, Jonathan Pan

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

Comments 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02862 2025-06-30 cs.CL cs.AI 79%

Cannot See the Forest for the Trees: Invoking Heuristics and Biases to Elicit Irrational Choices of LLMs

Haoming Yang, Ke Ma, Xiaojun Jia, Yingfei Sun, Qianqian Xu, Qingming Huang

机构 * School of Electronic, Electrical and communication Engineering, UCAS, Beijing.(电子电气与通信工程学院,中国科学院大学,北京) Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, CAS, Beijing.(智能信息处理重点实验室,计算技术研究所,中国科学院,北京) School of Computer Science and Technology, UCAS, Beijing.(计算机科学与技术学院,中国科学院大学,北京) Key Laboratory of Big Data Mining and Knowledge management, UCAS, Beijing(大数据挖掘与知识管理重点实验室,中国科学院大学,北京) Nanyang Technological University, Singapore.(南洋理工大学,新加坡) Shenzhen Campus of Sun Yat-sen University, Shenzhen.(孙中山大学深圳校区,深圳)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04931 2025-06-30 cs.CR cs.AI cs.CL 79%

Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency

Shiji Zhao, Ranjie Duan, Fengxiang Wang, Chi Chen, Caixin Kang, Shouwei Ruan, Jialing Tao, YueFeng Chen, Hui Xue, Xingxing Wei

机构 * Institution1(机构1) Institution2(机构2)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.CL、cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17458 2025-06-10 cs.CR cs.CL cs.LG 79%

RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking

Yifan Jiang, Kriti Aggarwal, Tanmay Laud, Kashif Munir, Jay Pujara, Subhabrata Mukherjee

机构 * Hippocratic AI(希波克拉底AI) Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.CL、cs.LG

Comments Accepted in ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09723 2025-05-27 cs.CR cs.AI cs.CL 79%

QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language

Qingsong Zou, Jingyu Xiao, Qing Li, Zhi Yan, Yuhang Wang, Li Xu, Wenxuan Wang, Kuofeng Gao, Ruoyu Li, Yong Jiang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) Jilin University(吉林大学) Southwest University(西南大学) University of Electronic Science and Technology of China(电子科技大学) Shenzhen University(深圳大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments To appear in ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09820 2025-05-16 cs.LG cs.CL cs.CR 79%

Adversarial Attack on Large Language Models using Exponentiated Gradient Descent

Sajib Biswas, Mao Nishino, Samuel Jacob Chacko, Xiuwen Liu

机构 * Department of Computer Science, Florida State University(计算机科学系,佛罗里达州立大学) Department of Mathematics, Florida State University(数学系,佛罗里达州立大学)

专题命中 越狱攻击 :RLHF(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments Accepted to International Joint Conference on Neural Networks (IJCNN) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02044 2025-05-08 cs.CL cs.LG 79%

Towards Universal and Black-Box Query-Response Only Attack on LLMs with QROA

Hussein Jawad, Yassine Chenik, Nicolas J. -B. Brunel

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19019 2025-04-29 cs.CL cs.AI cs.CR 79%

Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs

Mohammad Akbar-Tajari, Mohammad Taher Pilehvar, Mohammad Mahmoody

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10423 2025-04-15 cs.CL cs.AI 79%

Look Before You Leap: Enhancing Attention and Vigilance Regarding Harmful Content with GuidelineLLM

Shaoqing Zhang, Zhuosheng Zhang, Kehai Chen, Rongxiang Weng, Muyun Yang, Tiejun Zhao, Min Zhang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08104 2025-04-14 cs.CR cs.AI cs.CL 79%

Geneshift: Impact of different scenario shift on Jailbreaking LLM

Tianyi Wu, Zhiwei Xue, Yue Liu, Jiaheng Zhang, Bryan Hooi, See-Kiong Ng

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12145 2025-02-25 cs.CL cs.AI 79%

Na'vi or Knave: Jailbreaking Language Models via Metaphorical Avatars

Yu Yan, Sheng Sun, Junqi Tong, Min Liu, Qi Li

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Our study requires further in-depth research to ensure the comprehensiveness and adequacy of the methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05608 2025-01-22 cs.CR cs.AI cs.CL 79%

FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts

Yichen Gong, Delong Ran, Jinyuan Liu, Conglei Wang, Tianshuo Cong, Anyu Wang, Sisi Duan, Xiaoyun Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments AAAI 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12935 2025-01-08 cs.CR cs.AI cs.LG 79%

ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates

Fengqing Jiang, Zhangchen Xu, Luyao Niu, Bill Yuchen Lin, Radha Poovendran

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments This paper is accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00451 2024-12-20 cs.CR cs.AI cs.CL 79%

Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models

Wei Zhao, Zhe Li, Yige Li, Jun Sun

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12762 2024-11-28 cs.CL cs.AI 79%

Playing Language Game with LLMs Leads to Jailbreaking

Yu Peng, Zewen Long, Fangming Dong, Congyi Li, Shu Wu, Kai Chen

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09125 2024-11-15 cs.CL cs.AI 79%

DROJ: A Prompt-Driven Attack against Large Language Models

Leyang Hu, Boran Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16914 2024-11-13 cs.CR cs.AI cs.CL 79%

DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers

Xirui Li, Ruochen Wang, Minhao Cheng, Tianyi Zhou, Cho-Jui Hsieh

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08419 2024-07-22 cs.LG cs.AI 79%

Jailbreaking Black Box Large Language Models in Twenty Queries

Patrick Chao, Alexander Robey, Edgar Dobriban, Hamed Hassani, George J. Pappas, Eric Wong

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07932 2024-05-15 cs.CL cs.AI 79%

PARDEN, Can You Repeat That? Defending against Jailbreaks via Repetition

Ziyang Zhang, Qizhen Zhang, Jakob Foerster

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted at ICML 20224

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18534 2024-05-13 cs.CL cs.AI cs.CR cs.SE 79%

Evaluating and Mitigating Linguistic Discrimination in Large Language Models

Guoliang Dong, Haoyu Wang, Jun Sun, Xinyu Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21556 2025-05-29 cs.CV cs.AI 78%

Benign-to-Toxic Jailbreaking: Inducing Harmful Responses from Harmless Prompts

Hee-Seon Kim, Minbeom Kim, Wonjun Lee, Kihyun Kim, Changick Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 越狱攻击 :jailbreak(abstract,comments);alignment(abstract);safety(abstract);分类 cs.AI

Comments LVLM, Jailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏