arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1730 篇

2412.10321 2025-12-30 cs.LG cs.AI cs.CL cs.CR 80%

AdvPrefix: An Objective for Nuanced LLM Jailbreaks

AdvPrefix: 一种面向 nuanced LLM 模型 jailbreak 的目标

Sicheng Zhu, Brandon Amos, Yuandong Tian, Chuan Guo, Ivan Evtimov

机构 * University of Maryland, College Park(马里兰大学 College Park分校) FAIR, Meta(Meta的FAIR)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AdvPrefix 提出了一种新的目标,通过结合高预填充攻击成功率和低负对数似然来选择模型依赖的前缀,以提升 jailbreak 攻击的精确性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22957 2025-08-29 cs.CL cs.AI cs.CY cs.MA 80%

Agent-to-Agent Theory of Mind: Testing Interlocutor Awareness among Large Language Models

Younwoo Choi, Changling Li, Yongjin Yang, Zhijing Jin

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10066 2025-05-16 cs.CL cs.AI cs.CR cs.LG 80%

Dark LLMs: The Growing Threat of Unaligned AI Models

Michael Fire, Yitzhak Elbazis, Adi Wasenstein, Lior Rokach

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18210 2025-03-03 cs.CL cs.AI cs.CR cs.LG 80%

Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks

Samuele Poppi, Zheng-Xin Yong, Yifei He, Bobbie Chern, Han Zhao, Aobo Yang, Jianfeng Chi

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15140 2023-12-15 cs.CR cs.AI cs.CL cs.LG 80%

AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models

Sicheng Zhu, Ruiyi Zhang, Bang An, Gang Wu, Joe Barrow, Zichao Wang, Furong Huang, Ani Nenkova, Tong Sun

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Version 2 updates: Added comparison of three more evaluation methods and their reliability check using human labeling. Added results for jailbreaking Llama2 (individual behavior) and included complexity and hyperparameter analysis. Revised objectives for prompt leaking. Other minor changes made

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05945 2025-08-26 cs.CL cs.AI 80%

Head-Specific Intervention Can Induce Misaligned AI Coordination in Large Language Models

Paul Darm, Annalisa Riccardi

机构 * University of Strathclyde(斯特拉思克莱德大学)

专题命中 越狱攻击 :alignment(abstract,comments);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Published at Transaction of Machine Learning Research 08/2025, Large Language Models (LLMs), Interference-time activation shifting, Steerability, Explainability, AI alignment, Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14393 2025-04-22 cs.LG cs.CL 80%

Jailbreaking as a Reward Misspecification Problem

Zhihui Xie, Jiahui Gao, Lei Li, Zhenguo Li, Qi Liu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);red teaming(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICLR 2025. Code: https://github.com/zhxieml/remiss-jailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20991 2026-08-24 cs.LG 新提交 79%

Trojaning the Alignment: Stealthy Backdoor Attacks against Graph Foundation Models

对齐攻击:针对图基础模型的隐蔽后门攻击

Minhua Lin, Zhicheng Gao, Yilong Wang, Hanqing Lu, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.LG

AI总结 本文针对带文本属性图的图基础模型,提出STAG隐蔽特洛伊木马攻击框架,协调图触发器生成器与文本软提示实现后门攻击,经多数据集实验验证其有效性与隐蔽性。

Comments Accepted by ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09222 2026-08-10 cs.SD cs.AI 版本更新 79%

GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking

GRM:通过梯度比掩码实现音频大语言模型的效用感知越权攻击

Yunqiang Wang, Hengyuan Na, Di Wu, Miao Hu, Guocong Quan

机构 * Sun Yat-Sen University(中山大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出GRM框架,通过频率选择性扰动在音频大语言模型中实现效用感知的越权攻击,实验表明其在攻击成功率与效用平衡方面优于基线方法。

Comments Accpeted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14751 2026-08-07 cs.CR cs.AI 版本更新 79%

One Leak Away: How Pretrained Model Exposure Amplifies Jailbreak Risks in Finetuned LLMs

一个泄漏:预训练模型暴露如何放大微调LLM中的劫持风险

Yixin Tan, Zhe Yu, Rui Wen, Jun Sakuma

机构 * Institute of Science Tokyo(东京科学研究所) Riken AIP(理化学研究所AIP)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本研究揭示了预训练模型暴露如何放大微调LLM的劫持风险,提出PGP攻击方法,证明了预训练到微调过程中存在的安全漏洞。

Comments This paper has been accepted to the ACM SIGSAC Conference on Computer and Communications Security (ACM CCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06519 2026-08-04 cs.CR cs.AI 版本更新 79%

Can Small Language Models Reliably Resist Jailbreak Attacks? A Comprehensive Evaluation

小型语言模型能否可靠抵御越狱攻击?一项综合评估

Zhibo Wang, Wenhui Zhang, Huiyu Xu, Zeqing He, Ziqi Zhu, Kui Ren

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文通过评估59个SLMs对12种越狱方法的抵御能力,发现多数SLMs存在高ASR,漏洞与训练细节相关,且现有防御效果有限,凸显SLM需采用设计即安全的方法。

Comments Accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06605 2026-07-22 cs.LG 版本更新 79%

How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation

需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配

Shai Feldman, Yaniv Romano

机构 * Department of Computer Science(计算机科学系) Technion, Israel(技术ion, 以色列) Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG

AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12469 2026-07-15 cs.SE cs.AI 新提交 79%

Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric

作为承重证据的智能体安全评估:一种供应商中立的跨线束可重构性度量

Oleg Solozobov

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 研究智能体安全评估结果缺乏承重证据问题,引入属性级可重构性度量及跨线束适配器,通过特定协议和方法定义相关指标,在公共和捆绑轨迹上验证,为安全评估提供可重构性度量及相关验证方法。

Comments 36 pages, 3 tables. Reproducibility package (scorer, fixtures, Evidence Sufficiency Cards): https://doi.org/10.5281/zenodo.21055696

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01133 2026-07-01 cs.CR cs.LG cs.MA 版本更新 79%

When Embedding-Based Defenses Fail: Rethinking Safety in LLM-Based Multi-Agent Systems

基于嵌入的防御失效:重新思考基于大语言模型的多智能体系统的安全性

Lingxi Zhang, Guangtao Zheng, Hanjie Chen

机构 * Rice University(稻属大学) University of Virginia(弗吉尼亚大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG

AI总结 研究探讨了基于嵌入的防御在多智能体系统中的失效模式,提出利用置信度信号提升系统鲁棒性,通过实验验证了早期干预的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16751 2026-06-16 cs.CR cs.AI 新提交 79%

Automated jailbreak attack targeting multiple defense strategies

针对多种防御策略的自动化越狱攻击

Qi Wang, Chengcheng Wan, Weijia He, Yanqing Li, Hanqi Sun, Xiaodong Gu, Jiangtao Wang

机构 * East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院) University of Southampton(南安普顿大学) Shanghai Jiao Tong University(上海交通大学) Software Engineering Institute, East China Normal University(东华大学软件工程研究院)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI

AI总结 提出UNIATTACK框架,从防御视角提取攻击特征并优化,实现跨模型和类别的单次黑盒攻击,显著提升成功率并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27025 2026-05-27 cs.CL cs.MM 79%

Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations

基于属性的LLM与仇恨言论标注的对齐诊断

Mohammad Amine Jradi, Faeze Ghorbanpour, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL

AI总结 通过分析LLM在十个主观属性上的判断与人类标注的对齐情况,发现行为显式维度对齐良好而评价维度系统性反转,并提出基于置信度加权岭回归的属性组合方法,重构连续仇恨言论分数,R²达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02832 2026-05-18 cs.CR cs.AI 79%

FlipAttack: Jailbreak LLMs via Flipping

FlipAttack:通过翻转对大型语言模型进行劫持

Yue Liu, Xiaoxin He, Miao Xiong, Jinlan Fu, Shumin Deng, Yingwei Ma, Jiaheng Zhang, Bryan Hooi

机构 * Engineering Programme, NUS Graduate School, National University of Singapore(国立新加坡大学整合科学与工程计划) Institute of Data Science (IDS), National University of Singapore(国立新加坡大学数据科学研究所) Department of Computer Science, School of Computing, National University of Singapore(国立新加坡大学计算机科学系)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 FlipAttack通过在提示左侧添加噪声,利用语言模型自左向右理解文本的特性,实现对黑盒LLM的高效劫持,实验显示其在多个模型上均表现出高成功率。

Comments 43 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13420 2026-05-13 cs.CR cs.AI 79%

Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache

通过前缀共享KV缓存加速后缀劫持攻击

Xinhai Wang, Shaopeng Fu, Shu Yang, Liangyu Wang, Tianhang Zheng, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出PSKV技术,通过共享前缀KV缓存减少后缀劫持攻击的计算开销,实验表明在五种广泛部署的LLM上,PSKV将推理时间减少40%,峰值内存使用减少50%。

Comments 27 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11003 2026-05-13 cs.CR cs.AI 79%

The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents

授权-执行间隙是开放世界智能体中的主要安全和安全问题

Baoyuan Wu, Qingshan Liu, Adel Bibi, Irwin King, Siwei Lyu

机构 * Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Nanjing University of Posts and Telecommunications, China(南京邮电大学) University of Oxford, UK(牛津大学) Chinese University of Hong Kong, China(香港中文大学) State University of New York at Buffalo, USA(纽约州立大学布法罗分校)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 本文指出开放世界智能体中授权-执行间隙(AEG)是安全和安全的关键问题,其源于授权意图与实际执行的差异,需通过源导向的诊断和防御来解决,强调执行中需进行授权完整性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10611 2026-05-12 cs.CR cs.AI 79%

Re-Triggering Safeguards within LLMs for Jailbreak Detection

在大语言模型中重新触发安全机制以检测劫持

Zheng Lin, Zhenxing Niu, Haoxuan Ji, Yuzhe Huang, Haichang Gao

机构 * Xidian University(西安电子科技大学) Xi'an Jiaotong University(西安交通大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出一种大语言模型劫持提示检测方法,通过重新激活内部安全机制提升防御能力,实验表明其在白盒和黑盒环境下有效抵御最新劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08277 2026-05-12 cs.CR cs.AI 79%

Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

通过一个单个演示缓解多示例劫持攻击

Kejia Chen, Jiawen Zhang, Boheng Li, Pengcheng Li, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia, Tianwei Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI

AI总结 本文研究多示例劫持攻击为何随着演示数量增加而增强,提出通过添加固定单个安全演示来对抗该攻击,从而提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00706 2026-05-04 cs.CL 79%

FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

FinSafetyBench:评估LLM在现实金融场景中的安全性

Yutao Hou, Yihan Jiang, Yuhan Xie, Jian Yang, Liwen Zhang, Hailiang Huang, Guanhua Chen, Yun Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北航) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究重点实验室)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL

AI总结 本文提出FinSafetyBench,一个双语红队基准,用于测试LLM对违反金融合规请求的拒绝能力,揭示了对抗性提示绕过合规保障的关键漏洞及中文环境下更严重的易受攻击性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20945 2026-04-24 cs.CR cs.LG 79%

Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs

打破坏:基于可解释性的最新LLM安全审计

Krishiv Agarwal, Ramneet Kaur, Colin Samplawski, Manoj Acharya, Anirban Roy, Daniel Elenius, Brian Matejek, Adam D. Cobb, Susmit Jha

机构 * NuSCI Research Group, Computer Science Laboratory, SRI(NuSCI研究组、计算机科学实验室、SRI)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG

AI总结 本文提出基于可解释性的 jailbreaking 审计方法,评估了八种最新开源LLM的安全性,发现Llama-3模型易受攻击,而GPT-oss-120B表现稳健,Qwen和Phi模型结果混杂,揭示了可解释性工具在安全审计中的有效性及潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26238 2026-04-22 cs.LG 79%

Beyond Linear Probes: Dynamic Safety Monitoring for Language Models

超越线性探测:语言模型的动态安全监控

James Oldfield, Philip Torr, Ioannis Patras, Adel Bibi, Fazl Barez

机构 * Queen Mary University of London(伦敦玛丽女王大学) University of Oxford(牛津大学) WhiteBox Martian

专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG

AI总结 本文提出Truncated Polynomial Classifiers (TPCs),通过动态激活监控提升安全性能,实现灵活的成本控制,在有害提示分类中表现优异且更具可解释性。

Comments ICLR 2026; Minor revisions and clarifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10846 2026-04-17 cs.LG cs.CR 79%

AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models

AutoRAN:大型推理模型中安全推理的自动化劫持

Jiacheng Liang, Tanqiu Jiang, Yuhui Wang, Rongyi Zhu, Fenglong Ma, Ting Wang

机构 * Stony Brook University(石溪大学) Penn State University(宾夕法尼亚州立大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG

AI总结 AutoRAN通过执行模拟方法,利用较弱但对齐差的模型模拟初始劫持尝试,并通过目标LRM的拒绝泄露的推理模式迭代优化攻击,从而绕过安全防护并扩展有害指令。

Comments 10 pages, ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04930 2026-04-17 cs.CR cs.AI 79%

Attack Selection Reduces Safety in Concentrated AI Control Settings against Trusted Monitoring

攻击选择降低集中AI控制设置中对可信监控的安全性

Joachim Schaeffer, Arjun Khandelwal, Tyler Tracy

机构 * Pivotal Research(Pivotal研究) University of Oxford(牛津大学) Redwood Research(Redwood研究)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 研究攻击选择如何通过映射攻击到质量评分和提交概率影响安全性能,发现FPR对安全影响更大,提示需谨慎评估模型攻击能力以避免安全评分过高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25164 2026-03-27 cs.CR cs.AI 79%

PIDP-Attack: Combining Prompt Injection with Database Poisoning Attacks on Retrieval-Augmented Generation Systems

PIDP-Attack:将提示注入与数据库污染攻击结合在检索增强生成系统中

Haozhen Wang, Haoyue Liu, Jionghao Zhu, Zhichao Wang, Yongxin Guo, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Taobao and Tmall Group(淘宝和天猫集团)

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出PIDP-Attack,结合提示注入与数据库污染攻击,针对检索增强生成系统中的对抗攻击问题,通过在推理时添加恶意字符并注入少量污染文档,有效操控LLM响应,实验显示其在开放域问答任务中攻击成功率提升4%-16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11149 2026-03-20 cs.LG cs.CR 79%

Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models

大语言模型中越狱攻击的系统缩放分析

Xiangwen Wang, Ananth Balashankar, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG

AI总结 本文系统分析了大语言模型中越狱攻击的缩放规律,通过计算限制优化过程评估不同方法、模型家族和危害类型的攻击成功率,发现提示基方法在计算效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17519 2026-03-03 cs.CR cs.CL 79%

Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives

链式诱饵:一种利用无约束合成叙述的通用 jailbreak 攻击框架

Wenhan Chang, Tianqing Zhu, Yu Zhao, Shuangyong Song, Ping Xiong, Wanlei Zhou

机构 * School of Information Engineering, Zhongnan University of Economics and Law(中南财经政法大学信息工程学院) TeleAI, Beijing(北京TeleAI) City University of Macau(澳门城市大学)

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);分类 cs.CL

AI总结 本文提出了一种基于无约束合成叙述的通用jailbreak攻击框架,通过任务转移生成诱饵问题链并利用辅助模型优化,实现对LLMs的高成功率攻击,并提出毒性和防御策略。

Comments 23 pages, 3 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11495 2026-02-23 cs.CR cs.CL 79%

Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models

对大型语言模型进行劫持留有痕迹:从内部表示理解并检测劫持攻击

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于张量的潜在表示框架,通过分析LLM内部表示差异来检测劫持攻击,并在推理阶段主动干扰劫持执行。

详情

展开后加载摘要…

URL PDF HTML 收藏