arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1730 篇

2512.18755 2025-12-23 cs.AI 77%

MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking

MEEA: 基于mere exposure效应的对抗性优化用于LLM jailbreaking

Jianyi Zhang, Shizhao Liu, Ziyin Zhou, Zhen Li

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 MEEA通过基于mere exposure效应的对抗性优化,提升LLM jailbreaking的攻击成功率,揭示LLM安全行为的动态性和历史依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00781 2025-12-09 cs.AI 77%

CoP: Agentic Red-teaming for Large Language Models using Composition of Principles

CoP: 用于大型语言模型的代理式红队测试:原理组合

Chen Xiong, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong Sha Tin, Hong Kong(香港中文大学(深圳)) IBM Research New York, USA(IBM纽约研究院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 CoP通过原理组合框架实现LLMs红队测试自动化,发现新型jailbreak提示并显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16229 2025-11-21 cs.CR cs.AI 77%

Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security

Q-MLLM:向量量化用于鲁棒多模态大语言模型安全

Wei Zhao, Zhe Li, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 Q-MLLM通过两级向量量化提升多模态大语言模型的安全性,有效防御对抗性攻击并保持模型实用性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11851 2025-10-24 cs.CR cs.CL 77%

Deep Research Brings Deeper Harm

Shuo Chen, Zonggen Li, Zhen Han, Bailan He, Tong Liu, Haokun Chen, Georg Groh, Philip Torr, Volker Tresp, Jindong Gu

机构 * LMU Munich(慕尼黑大学) Siemens(西门子) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Munich (TUM)(慕尼黑技术大学) AWS AI(亚马逊AI) Konrad Zuse School of Excellence in Reliable AI (relAI)(Konrad Zuse卓越可靠AI学校) University of Hong Kong (HKU)(香港大学) University of Oxford(牛津大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Accepted to Reliable ML from Unreliable Data Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21761 2025-10-01 cs.CR cs.AI 77%

Backdoor Attribution: Elucidating and Controlling Backdoor in Language Models

Miao Yu, Zhenhong Zhou, Moayad Aloqaily, Kun Wang, Biwei Huang, Stephen Wang, Yueming Jin, Qingsong Wen

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) United Arab Emirates University(阿拉伯联合酋长国大学) University of California San Diego(加州大学圣地亚哥分校) Abel AI National University of Singapore(新加坡国立大学) Squirrel Ai Learning

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01872 2025-10-01 cs.CL 77%

Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions

Rachneet Sachdeva, Rima Hazra, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science and Hessian Center for AI (hessian.AI), Technical University of Darmstadt(德累斯顿技术大学计算机科学系、海斯堡人工智能中心(hessian.AI)、通用知识处理实验室(UKP Lab))

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02910 2025-09-30 cs.CV cs.AI 77%

ImgTrojan: Jailbreaking Vision-Language Models with ONE Image

Xijia Tao, Shuai Zhong, Lei Li, Qi Liu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00827 2025-09-26 cs.CV cs.AI 77%

IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves

Ruofan Wang, Juncheng Li, Yixu Wang, Bo Wang, Xiaosen Wang, Yan Teng, Yingchun Wang, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Huawei Technologies Ltd.(华为技术有限公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08000 2025-09-11 cs.CL 77%

AntiDote: Bi-level Adversarial Training for Tamper-Resistant LLMs

Debdeep Sanyal, Manodeep Ray, Murari Mandal

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07646 2025-08-12 cs.LG 77%

Multi-Turn Jailbreaks Are Simpler Than They Seem

Xiaoxue Yang, Jaeha Lee, Anna-Katharina Dick, Jasper Timm, Fei Xie, Diogo Cruz

机构 * Imperial College London(伦敦帝国学院) California Institute of Technology(加州理工学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.LG

Comments 25 pages, 15 figures. Accepted at COLM 2025 SoLaR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16447 2025-06-23 cs.CR cs.CL 77%

Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models

Biao Yi, Tiansheng Huang, Sishuo Chen, Tong Li, Zheli Liu, Zhixuan Chu, Yiming Li

机构 * College of Cyber Science, Nankai University(南开大学网络科学学院) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Nanyang Technological University(新加坡国立大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Accepted at ICLR 2025

Journal ref Proceedings of The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12274 2025-06-17 cs.CR cs.CL 77%

InfoFlood: Jailbreaking Large Language Models with Information Overload

Advait Yadav, Haibo Jin, Man Luo, Jun Zhuang, Haohan Wang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11647 2025-05-30 cs.CR cs.AI 77%

DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing

Yi Wang, Fenghua Weng, Sibei Yang, Zhan Qin, Minlie Huang, Wenjie Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16727 2025-01-31 cs.CL 77%

xJailbreak: Representation Space Guided Reinforcement Learning for Interpretable LLM Jailbreaking

Sunbowen Lee, Shiwen Ni, Chi Wei, Shuaimin Li, Liyang Fan, Ahmadreza Argha, Hamid Alinejad-Rokny, Ruifeng Xu, Yicheng Gong, Min Yang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12192 2024-12-18 cs.CR cs.AI 77%

No Free Lunch for Defending Against Prefilling Attack by In-Context Learning

Zhiyu Xue, Guangliang Liu, Bocheng Chen, Kristen Marie Johnson, Ramtin Pedarsani

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08615 2024-12-17 cs.CL 77%

Exploiting the Index Gradients for Optimization-Based Jailbreaking on Large Language Models

Jiahui Li, Yongchang Hao, Haoyu Xu, Xing Wang, Yu Hong

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 13 pages,2 figures, accepted by COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07921 2024-11-26 cs.CL 77%

AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs

Zeyi Liao, Huan Sun

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Published as a conference paper at COLM 2024 (https://colmweb.org/index.html)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21659 2024-10-18 cs.CL 77%

Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models

Yue Xu, Xiuyuan Qi, Zhan Qin, Wenjie Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 12 pages, 9 figures, EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05880 2024-07-04 cs.CL 77%

Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge

Weikai Lu, Ziqian Zeng, Jianwei Wang, Zhengdong Lu, Zelin Chen, Huiping Zhuang, Cen Chen

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09827 2024-03-01 cs.CL 77%

Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking

Nan Xu, Fei Wang, Ben Zhou, Bang Zheng Li, Chaowei Xiao, Muhao Chen

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01386 2024-01-23 cs.CL 77%

Who is ChatGPT? Benchmarking LLMs' Psychological Portrayal Using PsychoBench

Jen-tse Huang, Wenxuan Wang, Eric John Li, Man Ho Lam, Shujie Ren, Youliang Yuan, Wenxiang Jiao, Zhaopeng Tu, Michael R. Lyu

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Accepted for ICLR 2024 Oral Presentation. 15 pages (main text) and 5 pages (appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08729 2025-10-10 cs.CL cs.AI 76%

X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates

Hyunjun Kim, Junwoo Ha, Sangyoon Yu, Haon Park

机构 * AIM Intelligence(AIM智能)

专题命中 越狱攻击 :jailbreak(title);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Workshop on Lock-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25255 2026-07-31 cs.MA cs.CR 版本更新 75%

SafeFlow: Semantic Information-Flow Control for Blocking Malicious Propagation in Multi-Agent Systems

SafeFlow:用于多智能体系统中阻止恶意传播的语义信息流控制

Haowen Dai, Zonghao Ying, Wenfeng Li, Xiangfan Wu, Yisong Xiao, Tianyuan Zhang, Jiaye Lin, Lei Wei, Guangyuan Dong, Xitong Ling, Xixun Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 研究多智能体系统恶意传播问题,提出SafeFlow框架,将恶意跨智能体传播形式化为语义信息流问题,通过附加污点、传播及工作流级验证重建风险上下文,经测试降低攻击成功率,保持良性任务完成率,揭示系统缺乏跨委托边界保留风险语义机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24897 2026-07-29 cs.CR 新提交 75%

TYPO: Instruction-Dense Visual Jailbreaks against Commercial Closed-Source Image-Generation Models

TYPO:针对商业闭源图像生成模型的指令密集型视觉越狱

Meng Xie, Li Zeng, Hangtao Zhang, Xianlong Wang, Ziqi Zhou, Pengpeng Qiao, Zhetao Li

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 研究针对商业闭源图像生成模型安全漏洞,提出TYPO框架,通过自动生成对抗性排版提示,利用文本和视觉双通道策略空间及自适应组合搜索,有效实现指令密集型视觉越狱,性能优于其他攻击且成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 75%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29441 2026-06-30 cs.CR cs.AI cs.CL cs.ET cs.LG 75%

Closing the Activation-Cone Blind Spot: Response-Time Probing and Unified Defense

关闭激活锥盲点:响应时间探测与统一防御

Subhadip Mitra

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型推理时安全方法,发现提示时激活防御对预填充攻击存在结构性盲点,提出响应时间探测(线性探针)结合停止机制,将预填充攻击成功率降至0,并与AlphaSteer组合实现正交防御。

Comments 27 pages, 12 figures, 18 tables. Code and data: https://github.com/bassrehab/response-time-probing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25182 2026-06-25 cs.CL cs.AI cs.LG 新提交 75%

What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

中间层知道什么:从熵动力学检测越狱

Sofiia Nikolenko, Michele Papucci, Mina Rezaei, Shireen Kudukkil Manchingal

机构 * LMU Munich(慕尼黑大学) relAI – Konrad Zuse School of Excellence in Reliable AI(relAI – 康拉德·楚泽可靠人工智能卓越学校) University of Pisa(比萨大学) Munich Center for Machine Learning(慕尼黑机器学习中心) School of Engineering, Computing and Mathematics, Oxford Brookes University(牛津布鲁克斯大学工程、计算与数学学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过分析冻结LLM各层的token级预测熵轨迹,发现中间层的熵动力学特征(如基于排名的单调趋势分数)能有效检测越狱攻击,且无需额外训练。

Comments Accepted at the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD) 2026. A short version accepted at EIML@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05647 2026-06-05 cs.AI cs.CL cs.CY cs.HC 75%

Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

与“敌人”编码:人类开发者能否检测到AI代理的破坏行为?

Jingheng Ye, Huiqi Zou, Simon Yu, Weiyan Shi

机构 * Northeastern University(东北大学)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 通过大规模用户实验,研究人类开发者在长时间编码任务中检测AI代理恶意代码插入的能力,发现94%的开发者未能识别破坏,并分析其原因,提出安全监控设计建议。

Comments 34 pages, 30 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14399 2026-05-29 cs.CV 75%

Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models

多轮自适应提示攻击对大型视觉-语言模型

In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

机构 * The University of Melbourne(墨尔本大学) The University of Adelaide(阿德莱德大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 提出多轮自适应提示攻击(MAPA),通过交替文本-视觉攻击动作和跨轮迭代调整攻击轨迹,显著提升对大型视觉-语言模型的多轮越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11309 2026-04-14 cs.CR cs.AI cs.CL cs.CV cs.LG 75%

The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems

切肉威胁:在LLM系统中利用累积风险

Yihao Zhang, Kai Wang, Jiangrong Wu, Haolin Wu, Yuxuan Zhou, Zeming Wei, Dongxian Wu, Xun Chen, Jun Sun, Meng Sun

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Sun Yat-sen University(中山大学) Wuhan University(武汉大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ByteDance(字节跳动) Singapore Management University(新加坡管理大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Salami Slicing Risk,通过链式低风险输入累积有害意图,以触发高风险行为,提出Salami Attack框架并验证其有效性,同时提出防御策略以缓解多轮 jailbreak 风险。

详情

展开后加载摘要…

URL PDF HTML 收藏