arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1730 篇

2601.15331 2026-01-23 cs.CL cs.AI cs.CR cs.LG 67%

RECAP: A Resource-Efficient Method for Adversarial Prompting in Large Language Models

RECAP:一种资源高效的对抗性提示方法用于大型语言模型

Rishit Chugh

机构 * Rishit Chugh(独立研究者)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RECAP提出一种无需重新训练的高效对抗性提示方法,通过匹配预训练对抗性提示数据库,降低计算成本并提升攻击成功率。

Comments Code for RECAP is available at: https://github.com/R-C101/RECAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01741 2026-01-15 cs.CV 67%

Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models

模拟集成攻击:在微调视觉-语言模型之间转移劫持

Ruofan Wang, Xin Wang, Yang Yao, Juncheng Li, Xuan Tong, Xingjun Ma

机构 * Fudan University, Shanghai, China(复旦大学) The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 本文提出SEA框架,通过模拟微调过程中的参数变化,实现跨不同微调变体的高效劫持攻击,揭示了微调导致的局部参数位移对攻击有效性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06884 2026-01-13 cs.CL cs.AI cs.LG 67%

Paraphrasing Adversarial Attack on LLM-as-a-Reviewer

对LLM-as-a-Reviewer的改写对抗攻击

Masahiro Kaneko

机构 * MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种针对LLM作为评审员的改写对抗攻击方法,通过优化生成改写序列以提高评审评分,同时保持语义和语言自然性,并验证了其有效性及潜在的检测信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02377 2026-01-07 cs.RO 67%

Trust in LLM-controlled Robotics: a Survey of Security Threats, Defenses and Challenges

对LLM控制的机器人信任:安全威胁、防御和挑战的综述

Xinyu Huang, Shyam Karthick V B, Taozhao Chen, Mitch Bryson, Thomas Chaffey, Huaming Chen, Kim-Kwang Raymond Choo, Ian R. Manchester

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学机器人中心及航空航天、机械与机电工程学院) Department of Information Systems and Cybersecurity, University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系) School of Engineering and Natural Sciences, University of Iceland(冰岛大学工程与自然科学学院)

专题命中 越狱攻击 :safety(abstract);prompt injection(abstract)

AI总结 本文综述了LLM控制机器人面临的安全威胁和防御策略,强调了具身系统中恶意输出的物理风险,并提出了安全规范和多LLM监督等防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21008 2025-12-29 cs.CR 67%

GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs

GateBreaker: 对混合专家LLM的门控引导攻击

Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

AI总结 GateBreaker通过门控引导攻击破坏MoE LLM的安全对齐,发现安全机制集中在少量神经元上,禁用这些神经元显著提高攻击成功率。

Comments Accepted by USENIX Security'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19171 2025-12-23 cs.CR 67%

Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion

大语言模型是否威胁人类生存?通过前缀完成评估大语言模型潜在的灭绝性威胁

Yu Cui, Yifei Liu, Hang Fu, Sicheng Pan, Haibin Zhang, Cong Zuo, Licheng Wang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 本文提出 ExistBench 基准,通过前缀完成评估 LLMs 的潜在灭绝性威胁,发现 LLMs 生成内容包含危害人类生存的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01353 2025-12-18 cs.CR 67%

The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search

恶意知识:通过无害提示编织和自适应树搜索绕过商业大语言模型的安全防护

Rongzhe Wei, Peizhi Niu, Xinjie Shen, Tony Tu, Yifan Li, Ruihan Wu, Eli Chien, Pin-Yu Chen, Olgica Milenkovic, Pan Li

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 通过无害提示编织和自适应树搜索,研究提出CKA-Agent攻击方法,成功绕过商业大语言模型的安全防护,揭示了知识分解攻击的严重性。

Comments Updated with new baselines and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16110 2025-11-21 cs.CR 67%

Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models

多面攻击:揭示配备防御机制的视觉语言模型中的跨模型漏洞

Yijun Yang, Lichao Wang, Jianping Zhang, Chi Harold Liu, Lanqing Hong, Qiang Xu

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

AI总结 多面攻击揭示了配备防御机制的视觉语言模型中的跨模型安全漏洞,通过注意力转移攻击和轻量级转移增强算法,实现了58.5%的成功率。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02609 2025-11-12 cs.SE 67%

RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents

Chengquan Guo, Chulin Xie, Yu Yang, Zhaorun Chen, Zinan Lin, Xander Davies, Yarin Gal, Dawn Song, Bo Li

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01342 2025-10-10 cs.CR 67%

Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach

Xiangfang Li, Yu Wang, Bo Li

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00218 2025-10-10 cs.MA cs.AI cs.CL cs.LG 67%

$\textit{Agents Under Siege}$: Breaking Pragmatic Multi-Agent LLM Systems with Optimized Prompt Attacks

Rana Muhammad Shahroz Khan, Zhen Tan, Sukwon Yun, Charles Fleming, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) Cisco(思科)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23281 2025-09-30 cs.RO 67%

Preventing Robotic Jailbreaking via Multimodal Domain Adaptation

Francesco Marchiori, Rohan Sinha, Christopher Agia, Alexander Robey, George J. Pappas, Mauro Conti, Marco Pavone

机构 * University of Padova(帕多瓦大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Örebro University(奥雷布罗大学) NVIDIA Research(NVIDIA研究)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

Comments Project page: https://j-dapt.github.io/. 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13739 2025-09-25 cs.CV 67%

Enhancing Targeted Adversarial Attacks on Large Vision-Language Models via Intermediate Projector

Yiming Cao, Yanjie Li, Kaisheng Liang, Bin Xiao

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13329 2025-09-24 cs.CL cs.AI cs.LG 67%

Language Models Can Predict Their Own Behavior

Dhananjay Ashok, Jonathan May

机构 * Information Sciences Institute(信息科学研究所) University of Southern California(南加州大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Presented at the Thirty-Ninth Annual Conference on Neural Information Processing Systems (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00391 2025-09-03 cs.CL cs.AI cs.CR cs.LG 67%

The Resurgence of GCG Adversarial Attacks on Large Language Models

Yuting Tan, Xuying Li, Zhuo Li, Huizhen Shu, Peikang Hu

机构 * HydroX AI San Jose CA USA(HydroX AI)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01308 2025-08-05 cs.CV 67%

Safeguarding Vision-Language Models: Mitigating Vulnerabilities to Gaussian Noise in Perturbation-based Attacks

Jiawei Wang, Yushen Zuo, Yuanjun Chai, Zhendong Liu, Yicheng Fu, Yichun Feng, Kin-Man Lam

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学) Nanjing University(南京大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17052 2025-06-23 cs.LG cs.AI cs.CL 67%

From Concepts to Components: Concept-Agnostic Attention Module Discovery in Transformers

Jingtong Su, Julia Kempe, Karen Ullrich

机构 * NYU(纽约大学) Meta AI FAIR

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10794 2025-06-18 cs.CV 67%

Distraction is All You Need for Multimodal Large Language Model Jailbreaking

Zuopeng Yang, Jiluan Fan, Anli Yan, Erdun Gao, Xin Lin, Tao Li, Kanghua Mo, Changyu Dong

机构 * Guangzhou University(广州大学) Shanghai Jiao Tong University(上海交通大学) Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

Comments CVPR 2025 highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19684 2025-05-29 cs.CV 67%

VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models

Bingrui Sima, Linhua Cong, Wenxuan Wang, Kun He

机构 * Huazhong University of Science and Technology(华中科技大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18280 2025-05-20 cs.CL cs.AI cs.LG cs.NE 67%

Jailbreaking LLMs' Safeguard with Universal Magic Words for Text Embedding Models

Haoyu Liang, Youran Sun, Yunfeng Cai, Jun Zhu, Bo Zhang

机构 * Dept. of Comp. Sci. and Tech., Inst. for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, 100084, China(计算机科学与技术系、人工智能研究所、清华-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学、北京) Department of Mathematical Sciences, Tsinghua University(数学科学系、清华大学) BIMSA, Beijing, China(BIMSA、北京、中国)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06643 2025-05-13 cs.CR 67%

Practical Reasoning Interruption Attacks on Reasoning Large Language Models

Yu Cui, Cong Zuo

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21680 2025-05-01 cs.CR 67%

Hoist with His Own Petard: Inducing Guardrails to Facilitate Denial-of-Service Attacks on Retrieval-Augmented Generation of LLMs

Pan Suo, Yu-Ming Shang, San-Chuan Guo, Xi Zhang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

Comments 11 pages, 6 figures. This work will be submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11750 2025-03-18 cs.CV cs.CR 67%

Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization

Shuyang Hao, Yiwei Wang, Bryan Hooi, Jun Liu, Muhao Chen, Zi Huang, Yujun Cai

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00075 2025-03-03 cs.AI cs.CL cs.CR cs.LG 67%

Logicbreaks: A Framework for Understanding Subversion of Rule-based Inference

Anton Xue, Avishree Khare, Rajeev Alur, Surbhi Goel, Eric Wong

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08374 2025-02-13 cs.CV 67%

AdvSwap: Covert Adversarial Perturbation with High Frequency Info-swapping for Autonomous Driving Perception

Yuanhao Huang, Qinfan Zhang, Jiandong Xing, Mengyue Cheng, Haiyang Yu, Yilong Ren, Xiao Xiong

专题命中 越狱攻击 :safety(abstract);AI safety(abstract)

Comments 27th IEEE International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06390 2025-02-12 cs.CV 67%

When Data Manipulation Meets Attack Goals: An In-depth Survey of Attacks for VLMs

Aobotao Dai, Xinyu Ma, Lei Chen, Songze Li, Lin Wang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01154 2025-02-04 cs.CL cs.AI cs.CR cs.LG 67%

Jailbreaking with Universal Multi-Prompts

Yu-Ling Hsu, Hsuan Su, Shang-Tse Chen

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by NAACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00580 2025-02-04 cs.CR cs.AI cs.CL cs.CY 67%

Defense Against the Dark Prompts: Mitigating Best-of-N Jailbreaking with Prompt Evaluation

Stuart Armstrong, Matija Franklin, Connor Stevens, Rebecca Gorman

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16378 2025-01-29 cs.LG cs.AI cs.CL cs.CV 67%

Internal Activation Revision: Safeguarding Vision Language Models Without Parameter Update

Qing Li, Jiahui Geng, Zongxiong Chen, Kun Song, Lei Ma, Fakhri Karray

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16822 2024-12-12 cs.CL cs.AI cs.LG 67%

Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts

Mikayel Samvelyan, Sharath Chandra Raparthy, Andrei Lupu, Eric Hambro, Aram H. Markosyan, Manish Bhatt, Yuning Mao, Minqi Jiang, Jack Parker-Holder, Jakob Foerster, Tim Rocktäschel, Roberta Raileanu

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏