arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1730 篇

2405.01229 2025-03-04 cs.LG cs.AI cs.CL cs.CR math.OC 82%

Boosting Jailbreak Attack with Momentum

Yihao Zhang, Zeming Wei

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05223 2025-02-11 cs.CR cs.AI cs.CL cs.LG 82%

KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs

Buyun Liang, Kwan Ho Ryan Chan, Darshan Thaker, Jinqi Luo, René Vidal

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02705 2025-02-06 cs.CL cs.AI cs.CR cs.LG 82%

Certifying LLM Safety against Adversarial Prompting

Aounon Kumar, Chirag Agarwal, Suraj Srinivas, Aaron Jiaxun Li, Soheil Feizi, Himabindu Lakkaraju

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at COLM 2024: https://openreview.net/forum?id=9Ik05cycLq

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12210 2025-01-22 cs.CR 82%

You Can't Eat Your Cake and Have It Too: The Performance Degradation of LLMs with Jailbreak Defense

Wuyuao Mai, Geng Hong, Pei Chen, Xudong Pan, Baojun Liu, Yuan Zhang, Haixin Duan, Min Yang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18171 2024-12-30 cs.CR 82%

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models

Xiaomeng Hu, Pin-Yu Chen, Tsung-Yi Ho

专题命中 越狱攻击 :jailbreak(title,abstract);RLHF(abstract)

Comments Accepted by AAAI 2025. Project page: https://huggingface.co/spaces/TrustSafeAI/Token-Highlighter

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01376 2024-07-02 cs.LG cs.AI cs.CL cs.CR 82%

Badllama 3: removing safety finetuning from Llama 3 in minutes

Dmitrii Volkov

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04031 2024-07-02 cs.CV cs.CR 82%

Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt

Zonghao Ying, Aishan Liu, Tianyuan Zhang, Zhengmin Yu, Siyuan Liang, Xianglong Liu, Dacheng Tao

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14348 2024-06-13 cs.CL cs.AI cs.CR cs.LG 82%

Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM

Bochuan Cao, Yuanpu Cao, Lu Lin, Jinghui Chen

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 Pages, 5 Figures, 8 Tables. Accepted by ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09798 2024-04-25 cs.CL cs.AI cs.CY 82%

All in How You Ask for It: Simple Black-Box Method for Jailbreak Attacks

Kazuhiro Takemoto

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.CY

Comments 12 pages, 4 figures, 3 tables

Journal ref Appl. Sci. 14, 3558 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05274 2024-04-16 cs.CR 82%

FuzzLLM: A Novel and Universal Fuzzing Framework for Proactively Discovering Jailbreak Vulnerabilities in Large Language Models

Dongyu Yao, Jianshu Zhang, Ian G. Harris, Marcel Carlsson

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

Comments Publish by ICASSP 2024 on 3/18/2024; Extended Arxiv version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20102 2026-05-25 cs.LG cs.AI 82%

BarrierSteer: LLM Safety via Learning Barrier Steering

BarrierSteer: 通过学习障碍引导实现大语言模型安全

Thanh Q. Tran, Arun Verma, Kiwan Wong, Bryan Kian Hsiang Low, Daniela Rus, Wei Xiao

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联合研究中心) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Worcester Polytechnic Institute(沃斯堡理工学院)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出 BarrierSteer 框架,通过将学习到的非线性安全约束作为控制障碍函数嵌入潜在表示空间,在推理时引导模型生成安全内容,理论保证且不修改模型参数。

Comments This paper introduces SafeBarrier, a framework that enforces safety in large language models by steering their latent representations with control barrier functions during inference, reducing adversarial and unsafe outputs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07696 2026-07-09 cs.DB cs.AI 新提交 81%

Breaking Database Lock-in: Agentic Regeneration of High Performance Storage Readers for Database Bypass

打破数据库锁定:用于数据库绕过的高性能存储读取器的智能再生

Victor Giannakouris, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);分类 cs.AI

AI总结 研究分析工作负载面临的数据访问瓶颈问题,提出Jailbreak方法,利用大语言模型辅助代码合成绕过数据库引擎直接读取存储文件,在PostgreSQL和MySQL上评估,性能显著提升,证明该方法可打破数据库系统数据锁定。

Comments To be presented at AIDB 2026 (co-located with VLDB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27545 2026-05-28 cs.CL 81%

PAST2HARM: A Simple Adaptive Past Tense Attack for Jailbreaking Multimodal AI

PAST2HARM:一种用于越狱多模态AI的简单自适应过去时攻击

Snehasis Mukhopadhyay

机构 * Indian Institute of Information Technology, Kalyani(印度信息技术学院,卡利安)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);red teaming(abstract)

AI总结 提出PAST2HARM框架,通过过去时态改写和迭代升级策略,系统性地利用多模态文本到图像模型的安全漏洞,实现黑盒、无梯度的高成功率越狱攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00974 2026-05-05 cs.CR cs.CL 81%

SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking

SRTJ:自演化规则驱动的无训练LLM jailbreaking

Jindong Li, Ying Liu, Yali Fu, Jinjing Zhu, Leyao Wang, Menglin Yang, Rex Ying

机构 * HKUST (GZ)(香港科技大学(广州)) Jilin University(吉林大学) Yale University(耶鲁大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 SRTJ通过交互反馈系统发现、组合和优化攻击策略,无需更新模型参数,有效平衡探索与利用,提升攻击鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04802 2026-04-28 cs.CL 81%

Mind the Gap: Evaluating Model- and Agentic-Level Vulnerabilities in LLMs with Action Graphs

注意差距:通过动作图评估LLM在模型和代理层面的漏洞

Ilham Wicaksono, Zekun Wu, Rahul Patel, Theo King, Adriano Koshiyama, Philip Treleaven

机构 * Holistic AI University College London(伦敦大学学院)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);分类 cs.CL

AI总结 本文通过动作图评估LLM在模型和代理层面的漏洞,揭示了代理层面特有的风险,并展示了通过动作图改进提示能有效降低代理 jailbreak 成功率。

Comments ICLR 2026 Agents in the Wild (Spotlight & Oral); ICLR 2026 AFAA; OpenAI Red-Teaming Challenge Winner (2025); NeurIPS 2025 LLMEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10307 2026-01-16 cs.CL 81%

The Straight and Narrow: Do LLMs Possess an Internal Moral Path?

直行与狭窄:大型语言模型是否具有内在的道德路径?

Luoming Hu, Jingjie Zeng, Liang Yang, Hongfei Lin

机构 * School of Future Technology, Dalian University of Technology, China(大连理工大学未来技术学院) School of Computer Science and Technology, Dalian University of Technology, China(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence, Ministry of Education, China(教育部社会计算与认知智能重点实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)

AI总结 本文通过道德基础理论探索LLMs的道德表示,提出自适应道德融合方法,以增强模型的道德对齐性并减少安全与有用性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21236 2025-12-25 cs.CR cs.AI cs.SE 81%

Casting a SPELL: Sentence Pairing Exploration for LLM Limitation-breaking

为LLM突破限制而探索句子配对:恶意代码生成的测试框架

Yifan Huang, Xiaojun Jia, Wenbo Guo, Yuqiang Sun, Yihao Huang, Chong Wang, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)

AI总结 SPELL框架通过智能句子配对探索LLM在恶意代码生成中的安全漏洞,有效提升对抗测试效果。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14853 2025-08-21 cs.LG 81%

Universal and Transferable Adversarial Attack on Large Language Models Using Exponentiated Gradient Descent

Sajib Biswas, Mao Nishino, Samuel Jacob Chacko, Xiuwen Liu

机构 * Department of Computer Science, Florida State University(计算机科学系,佛罗里达州立大学) Department of Mathematics, Florida State University(数学系,佛罗里达州立大学)

专题命中 越狱攻击 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04322 2025-08-05 cs.LG cs.AI cs.CL cs.CY 81%

Speak Easy: Eliciting Harmful Jailbreaks from LLMs with Simple Interactions

Yik Siu Chan, Narutatsu Ri, Yuxin Xiao, Marzyeh Ghassemi

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02916 2025-04-10 cs.CR cs.AI 81%

LLM Safeguard is a Double-Edged Sword: Exploiting False Positives for Denial-of-Service Attacks

Qingzhao Zhang, Ziyang Xiong, Z. Morley Mao

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05498 2025-02-06 cs.CR cs.AI 81%

SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner

Xunguang Wang, Daoyuan Wu, Zhenlan Ji, Zongjie Li, Pingchuan Ma, Shuai Wang, Yingjiu Li, Yang Liu, Ning Liu, Juergen Rahmel

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)

Comments Accepted by USENIX Security Symposium 2025. Please cite the conference version of this paper, i.e., "Xunguang Wang, Daoyuan Wu, Zhenlan Ji, Zongjie Li, Pingchuan Ma, Shuai Wang, Yingjiu Li, Yang Liu, Ning Liu, and Juergen Rahmel. SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner. In Proc. USENIX Security, 2025."

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17915 2024-12-25 cs.CR cs.AI 81%

The Dark Side of Function Calling: Pathways to Jailbreaking Large Language Models

Zihui Wu, Haichang Gao, Jianping He, Ping Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04392 2024-09-10 cs.CR cs.AI 81%

Fine-Tuning, Quantization, and LLMs: Navigating Unintended Outcomes

Divyanshu Kumar, Anurakt Kumar, Sahil Agarwal, Prashanth Harshangi

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15211 2024-12-17 cs.CL cs.AI cs.CR cs.CV cs.LG 81%

Failures to Find Transferable Image Jailbreaks Between Vision-Language Models

Rylan Schaeffer, Dan Valentine, Luke Bailey, James Chua, Cristóbal Eyzaguirre, Zane Durante, Joe Benton, Brando Miranda, Henry Sleight, John Hughes, Rajashree Agrawal, Mrinank Sharma, Scott Emmons, Sanmi Koyejo, Ethan Perez

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024 Workshops: RBFM (Best Paper), Frontiers in AdvML (Oral), Red Teaming GenAI (Oral), SoLaR (Spotlight), SATA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19737 2026-08-21 cs.CV cs.AI cs.CL 新提交 81%

TempJail: Temporal Jailbreak Attack against Large Vision-Language Models via Subtitle Scheduling

TempJail:基于字幕时序调度的针对大型视觉语言模型的时序越狱攻击

Ling Zhou, Yihao Huang, Jingling Sun, Zhiwen Tian, Yi Zeng, Qihe Liu, Shijie Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) East China Normal University(华东师范大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 TempJail是一种黑盒视频越狱框架,通过优化字幕时序调度攻击LVLMs,在四个模型和两个数据集上的攻击成功率优于基线。

Comments 8 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08383 2026-08-11 cs.CL cs.LG 新提交 81%

Safety Cost of Steering Vectors Is Separable and Reducible

引导向量的安全代价是可分离且可降低的

Yuxiao Li, Gjergji Kasneci

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究针对引导向量破坏LLM安全机制的问题,通过识别并移除其安全退化分量,提出带约束的原始对偶优化方法,可在保留引导效果的同时大幅降低安全退化。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26574 2026-08-11 cs.CR cs.AI cs.LG 版本更新 81%

Attack Ensembles Expose a Safety-Utility Trade-off in Black-Box Guard Defenses Against Encoded VLM Jailbreaks

恢复、解码、再防护:针对编码型VLM越狱的防护无关型防御放大技术

Haoyu Zhang, Zhuoxi Wang, Shibo Zheng, Yi Feng, Xiao Luo, Zijian Xiao, Haowen Xu, Xiangchen Guan, Mohammad Zandsalimy, Shanu Sushmita

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出防护无关型的恢复-解码放大器,评估其对11种攻击集成的编码型VLM越狱防御效果,发现其存在安全-效用上限,贡献了放大器、集成评估方法及防御适用场景图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01388 2026-08-04 cs.CR cs.AI cs.LG 新提交 81%

Why Formal Monitors Fail: Attack Distribution Entropy as a Coverage Bound for LTL-Based LLM Agent Safety

形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界

Ruiyang Zhang

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。

Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20494 2026-07-24 cs.AI cs.CR cs.LG 新提交 81%

Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation

从正则表达式中分离大语言模型对齐:对抗性变异下的零覆盖率和度量相关散度

Alexandre Cristovão Maiorano

机构 * Vertex AI(顶点人工智能)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在语料库被设计绕过正则表达式时大语言模型对齐情况,引入$L_5$-无正则表达式并评估,发现对齐贡献度量相关,自然语言探针中无额外覆盖率提升,对抗性变体中能检测到子串分类器错过的拒绝。

Comments 15 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20508 2026-06-19 cs.AI cs.LG 新提交 81%

What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations?

安全对齐的LLM从混合顺从演示中学到了什么?

Sihui Dai, Mann Patel

专题命中 越狱攻击 :safety(title);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 研究通过混合良性顺从演示和有害顺从演示,探究演示组成如何驱动有害顺从,发现演示内容、顺序和训练方法影响模型提取的信息。

详情

展开后加载摘要…

URL PDF HTML 收藏