arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1730 篇

2406.18725 2024-10-04 cs.LG cs.CL 73%

Jailbreaking LLMs with Arabic Transliteration and Arabizi

Mansour Al Ghanim, Saleh Almohaimeed, Mengxin Zheng, Yan Solihin, Qian Lou

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments Accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17447 2024-10-02 cs.CL cs.AI 73%

FLRT: Fluent Student-Teacher Redteaming

T. Ben Thompson, Michael Sklar

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02651 2024-08-06 cs.CL cs.AI cs.CR 73%

Can Reinforcement Learning Unlock the Hidden Dangers in Aligned Large Language Models?

Mohammad Bahrami Karkevandi, Nishant Vishwamitra, Peyman Najafirad

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted to AI4CYBER - KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14725 2024-06-25 cs.CR cs.CL cs.LG 73%

Testing the Limits of Jailbreaking Defenses with the Purple Problem

Taeyoun Kim, Suhas Kotha, Aditi Raghunathan

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15902 2024-05-28 cs.CR cs.AI cs.CL cs.HC 73%

Hacc-Man: An Arcade Game for Jailbreaking LLMs

Matheus Valentim, Jeanette Falk, Nanna Inie

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16717 2024-02-27 cs.CL cs.AI cs.CR 73%

CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models

Huijie Lv, Xiao Wang, Yuansen Zhang, Caishuang Huang, Shihan Dou, Junjie Ye, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09127 2024-01-23 cs.CR cs.AI cs.LG 73%

Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts

Yuanwei Wu, Xiang Li, Yixin Liu, Pan Zhou, Lichao Sun

专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09473 2023-11-17 cs.AI cs.CL 73%

JAB: Joint Adversarial Prompting and Belief Augmentation

Ninareh Mehrabi, Palash Goyal, Anil Ramakrishna, Jwala Dhamala, Shalini Ghosh, Richard Zemel, Kai-Wei Chang, Aram Galstyan, Rahul Gupta

专题命中 越狱攻击 :safety(abstract);red teaming(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.11032 2021-08-26 cs.CV cs.AI cs.LG 73%

Improving Visual Quality of Unrestricted Adversarial Examples with Wavelet-VAE

Wenzhao Xiang, Chang Liu, Shibao Zheng

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01446 2024-08-06 cs.CL cs.CV cs.NE 72%

Open Sesame! Universal Black Box Jailbreaking of Large Language Models

Raz Lapid, Ron Langberg, Moshe Sipper

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL;trustworthy(journal_ref)

Comments Accepted at SeT-LLM @ ICLR 2024

Journal ref ICLR 2024 Workshop on Secure and Trustworthy Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17223 2026-06-17 cs.CR 新提交 71%

Safety, Security, and Cognitive Risks in Neuro-Symbolic AI

神经符号AI中的安全性、安全性和认知风险

Manoj Parmar

专题命中 越狱攻击 :safety(title)

AI总结 本文系统分析了神经符号AI在五层架构中的攻击面,提出统一威胁模型、符号层威胁目录及认知风险分析,并通过三个实证基准验证了攻击的有效性与检测挑战。

Comments 28 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10133 2026-05-12 cs.CR cs.SE 71%

Usability as a Weapon: Attacking the Safety of LLM-Based Code Generation via Usability Requirements

可用性作为武器:通过可用性需求攻击基于LLM的代码生成的安全性

Yue Li, Xiao Li, Hao Wu, Yue Zhang, Yechao Zhang, Yating Liu, Fengyuan Xu, Sheng Zhong

专题命中 越狱攻击 :safety(title)

AI总结 研究通过可用性需求攻击LLM生成代码的安全性,提出U-SPLOIT框架,利用可用性压力导致安全约束被忽略,成功率达98.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11619 2025-03-17 cs.CR 71%

Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense

Shuyang Hao, Yiwei Wang, Bryan Hooi, Ming-Hsuan Yang, Jun Liu, Chengcheng Tang, Zi Huang, Yujun Cai

专题命中 越狱攻击 :jailbreak(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17360 2026-08-19 cs.CR cs.AI 新提交 70%

Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets

Fair ASR:在共享目标调用预算下重新评估黑盒越狱攻击

Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究提出Fair-ASR评估协议,重新评估11种黑盒越狱攻击,发现攻击排名随预算变化,进而提出ReCode攻击,在20次目标调用预算下于GPT-5实现85% ASR且效率优异。

Comments 29 pages, 8 figures, 13 tables. Code: https://github.com/xsddys/Fair-ASR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15594 2026-08-18 cs.AI 新提交 70%

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

TRACE:面向多轮对抗对话评估的轨迹感知推理

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) Amazon(亚马逊公司)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07672 2026-08-18 cs.CR cs.CL 版本更新 70%

DYNASHIELD: A Black-Box Moving Target Defense for LLMs via Dynamic Decoding Customization

DYNASHIELD:一种通过动态解码定制实现的大语言模型黑盒移动目标防御

Xiaoqun Liu, Weiming Qi, Qiben Yan

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 DYNASHIELD是一种无需访问模型内部或重新训练的黑盒LLM防御框架,通过动态定制解码配置降低了4种越狱攻击的成功率,同时保持响应质量且开销极小。

Comments Accepted by The 29th International Symposium on Research in Attacks, Intrusions and Defenses (RAID) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23496 2026-08-14 cs.AI cs.CR 版本更新 70%

Do LLMs Know Their Vulnerable Scenarios?

大语言模型知道它们的脆弱场景吗?

Ziheng Peng, Huiqi Deng, Haoran Jing, Xuankun Rong, Jiahui Han, Xiting Wang, Na Zou, Xia Hu

机构 * Renmin University of China(中国人民大学) Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究大语言模型在特定场景下的脆弱性,提出Concept2Scenario框架,通过实例化概念空间、归因拒绝抑制等步骤发现脆弱场景,在多模型和基准测试中验证,能提高攻击成功率、可迁移且组合效果优。

Comments 19 pages, 11 Figures, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11025 2026-08-12 cs.CL 新提交 70%

Data Attribution of Emergent Misalignment with Persona Features

基于角色特征的涌现失配数据归因

Clemens Vetter, David Kaczér, Lucie Flek, Florian Mai

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛信息技术中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本研究基于SAE分析揭示EM源于角色特征,操控特征可双向控制EM,发现人类文本无法可靠诱导EM而合成指令响应对可以,明确响应结构或模型措辞的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09551 2026-08-11 cs.CL 新提交 70%

Pragmatic Attack Surface: Vulnerabilities of Implicit Context in Large Language Models

语用攻击面:大语言模型中隐式上下文的漏洞

Bocheng Chen, Han Zi, Roucheng Ou, Yawei Liu, Minyue Chen, Zimo Qi, Rongrong Wang, Guangliang Liu

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出大语言模型存在语用攻击面漏洞,利用人类语言解读与安全对齐的隐式上下文不匹配,所提攻击方法在各类模型上的成功率大幅优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08815 2026-08-11 cs.LG 新提交 70%

Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles

用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏

Pedram MohajerAnsari, Amir Salarpour, Mert D. Pesé

机构 * Clemson University(克莱姆森大学)

专题命中 越狱攻击 :alignment(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01043 2026-08-11 cs.CR cs.AI 版本更新 70%

Decoy Images Amplify Caption-Mediated Defenses Against Encoded Jailbreaks

诱饵图像增强针对编码越狱的字幕介导防御

Haoyu Zhang, Xiangchen Guan, Shibo Zheng, Mohammad Zandsalimy, Shanu Sushmita

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 该研究发现附加诱饵图像可降低VLMs的编码越狱攻击成功率,通过编码输入检测器门控附加诱饵,可在保留安全增益的同时控制良性弃权率,该效应在多模型、多场景下可复现。

Comments There is bug in algorithm implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18056 2026-08-07 cs.CL q-bio.GN 版本更新 70%

An Early Warning of Emerging Biosecurity Risks in Frontier LLMs

前沿大语言模型中新兴生物安全风险的早期预警

Zhida He, Xia Hu, Baichen Le, Chunxiao Li, Jiajia Li, Lijun Li, Chaochao Lu, Jing Shao, Youbang Sun, Hua Tang, Xiang Wang, Xiao Wang, Xiaoyu Wen, Tong Wu, Jia Xu, Peng Yu, Shu Yu, Jie Zhang, Qiaosheng Zhang, Yi Zhang, Xing-Ming Zhao, Tianhang Zheng, Ziyuan Zhou

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 研究前沿大语言模型生物安全风险,开发Intern-BioBreaker及综合框架,通过生成提示、实验验证评估风险。发现文本级安全与模型风险有差距,模型存在越狱漏洞,能生成有害序列且可物理实现,强调加强相关安全机制。

Comments 22 pages, 7 figures, authors are listed alphabetically by surname; update Figure 7 on page 15 due to arXiv format requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02422 2026-08-06 cs.CR cs.AI 版本更新 70%

Dynamic Jailbreaking Attack

动态目标攻击

Kedong Xiu, Yunhan Yang, Churui Zeng, Tianhang Zheng, Xinzhe Huang, Di Wang, Puning Zhao, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Nanyang Technological University(南洋理工大学) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科技大学) SUN YAT-SEN UNIVERSITY(孙中山大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 动态目标攻击通过利用目标模型自身响应作为自适应目标,提高了对抗攻击的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03210 2026-08-05 cs.CL 新提交 70%

ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization

ICO:通过迭代上下文优化增强语义偏移越狱攻击

Hujian Zhu, Yihao Huang, Felix Juefei-Xu, Xinfeng Li, Peng Zeng, Simeng Qin, Qing Guo, Geguang Pu

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本研究针对现有语义偏移越狱攻击有效性有限的问题,提出带迭代上下文优化(ICO)的黑盒上下文感知框架,经多数据集与多模型实验,其攻击效果优于现有基线,平均成功率达74.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01558 2026-08-04 cs.AI cs.CR cs.MA 新提交 70%

Securing Agentic AI: From Per-Action Checks to Trajectory Assurance

安全智能体AI:从单步行动检查到轨迹保障

Alireza Lotfi, Subangkar Karmaker Shanto, Imtiaz Karim, Elisa Bertino

机构 * Purdue University(普渡大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 越狱攻击 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 该研究围绕自主智能体安全领域,梳理了单智能体、多智能体及宏观层面的各类安全挑战,提出安全需成为智能体架构等的可验证属性,为可信自主智能体部署提供路线图。

Comments 6 pages. Accepted to the ACM AI Leadership Summit 2026 (Visionary Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11070 2026-07-14 cs.CL 新提交 70%

MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment

MJ:通过分解信用分配实现多轮语言模型越狱

Junyoung Park, Namgyu Park, Sechan Lee, Yoon-Chan Jhi, Jihoon Cho, Sangdon Park

机构 * POSTECH GSAI(浦项科技大学全球人工智能学院) Samsung SDS(三星 SDS)

专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.CL

AI总结 研究针对多轮语言模型越狱的信用分配难题,提出DC-GRPO框架,通过结合即时和未来信用为各轮次分配学习信号,经静态和动态加权规则实例化,在多模型和基准测试中显著优于现有方法,核心优势在于轮次级组相对信用分配。

Comments 29 pages. Warning: This paper contains examples of harmful content

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07903 2026-07-10 cs.CR cs.AI 新提交 70%

Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

通过内部归因图对大语言模型越狱进行机制性可解释性研究

Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang, Longwei Wang

机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) School of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究大语言模型越狱漏洞,通过构建内部计算图揭示对抗攻击引发的内部推理转变,提出统一框架实现因果诊断,实验证明计算图偏差与不安全行为相关,干预可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02999 2026-07-09 cs.CR cs.AI 版本更新 70%

NonTextual Target Attack

非文本目标攻击

Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone, Binjiang Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区,滨江区块链与数据安全研究院) School of Cyberspace Security, Nanjing University of Science and Technology(网络安全学院,南京理工大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,新加坡国立大学) King Abdullah University of Science and Technology (KAUST)(卡布斯科学与技术大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 针对现有大语言模型越狱攻击的局限,提出非文本目标攻击NTA,通过非文本约束目标最大化不安全概率,分解目标便于优化,扩展攻击空间,在AdvBench上对安全对齐的大语言模型仅100次迭代,平均成功率达96.8%,性能远超现有攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00481 2026-07-02 cs.CR cs.AI 新提交 70%

Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces

超越提示:通过模拟审核轨迹越狱函数调用大语言模型

Junlong Liu, Haobo Wang, Weiqi Luo, Xiaojun Jia

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 针对函数调用大语言模型的结构性漏洞,提出基于模拟审核轨迹的黑盒攻击框架SMT,通过多轮交互绕过安全约束,在多个商业模型上实现高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19127 2026-07-01 cs.LG 版本更新 70%

On Optimizing Multimodal Jailbreaks for Spoken Language Models

关于优化口语语言模型的多模态越狱攻击

Aravind Krishnan, Karolina Stańczak, Dietrich Klakow

机构 * Saarland University(萨尔大学) DFKI GmbH(德国人工智能研究中心) ETH AI Center(ETH人工智能中心)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 提出联合音频文本多模态攻击框架JAMA,通过梯度优化同时扰动语音和文本模态,在四个SLM上实现1.5至20倍于单模态的越狱成功率,并分析其运行机制。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏