arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1731 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1731 篇

2601.02680 2026-01-07 cs.CR cs.LG 57%

Adversarial Contrastive Learning for LLM Quantization Attacks

对抗对比学习用于大语言模型量化攻击

Dinghong Song, Zhiwei Xu, Hai Wan, Xibin Zhao, Pengfei Su, Dong Li

机构 * Tsinghua University(清华大学) University of California, Merced(加州大学默塞德分校)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 本文提出对抗对比学习方法,通过最大化良性与有害响应概率差距,有效提升大语言模型量化攻击的成功率。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18733 2025-12-23 cs.CR cs.AI cs.MA 57%

Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection

通过双层图异常检测实现LLM多智能体系统的可解释性与细粒度防护

Junjun Pan, Yixin Liu, Rui Miao, Kaize Ding, Yu Zheng, Quoc Viet Hung Nguyen, Alan Wee-Chung Liew, Shirui Pan

机构 * School of Information and Communication Technology, Griffith University, Australia(格里菲斯大学信息与通信技术学院) School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院) Department of Statistics and Data Science, Northwestern University, USA(西北大学统计与数据科学系)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出XG-Guard框架,通过双层图异常检测实现对LLM多智能体系统中恶意智能体的可解释性与细粒度检测。

Comments 14 pages, 3 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17041 2025-12-22 cs.AI cs.SY eess.SY 57%

Security Risks of Agentic Vehicles: A Systematic Analysis of Cognitive and Cross-Layer Threats

代理车辆的安全风险:对认知和跨层威胁的系统分析

Ali Eslami, Jiangbo Yu

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出基于角色的架构,分析代理车辆中认知和跨层安全威胁,提供首个结构化分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14741 2025-12-18 cs.CR cs.AI 57%

Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs

在LLM持续微调下的持久后门攻击

Jing Cui, Yufei Han, Jianbin Jiao, Junge Zhang

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出P-Trojan算法,研究在LLM持续微调中后门的持久性问题,实验显示其在保持清洁任务准确性的同时实现高持久性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14448 2025-12-17 cs.CR cs.AI 57%

Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space

通过隐蔽的风格迁移进行LLM代理的推理风格污染:过程级攻击与运行时监控在RSV空间中

Xingfu Zhou, Pengfei Wang

机构 * college of computer science, National University of Defense Technology(计算机科学学院,国防科技大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本研究提出推理风格污染攻击,通过隐蔽方式改变LLM代理的推理风格,导致性能下降并绕过内容过滤,提出运行时监控方法应对该漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13703 2025-12-17 cs.CR cs.AI 57%

Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models

Safe2Harm: 语义同构攻击用于大型语言模型的劫持

Fan Yang

机构 * Jinan University(济南大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 Safe2Harm通过语义同构攻击方法,利用合法与有害场景的底层原理一致性,实现高效的大规模语言模型劫持,并提出有害内容评估数据集用于防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11986 2025-12-16 cs.LG 57%

Learning to Extract Context for Context-Aware LLM Inference

学习提取上下文以实现上下文感知的LLM推理

Minseon Kim, Lucas Caccia, Zhengyan Shi, Matheus Pereira, Marc-Alexandre Côté, Xingdi Yuan, Alessandro Sordoni

机构 * Microsoft Research(微软研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出通过提取上下文信息提升LLM推理的安全性,减少有害输出并提高合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23453 2025-12-16 cs.CR cs.CL 57%

Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems

对抗性评估用于基于大语言模型的评估系统的盲攻击检测

Lijia Liu, Takumi Kondo, Kyohei Atarashi, Koh Takeuchi, Jiyi Li, Shigeru Saito, Hisashi Kashima

机构 * Kyoto University(京都大学) Hokkaido University(北海道大学) SIGNATE, Inc.(SIGNATE公司)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL

AI总结 本文提出SE+CFE框架,通过反事实评估提升基于大语言模型的评估系统对盲攻击的检测能力,同时保持性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17248 2025-12-16 cs.LG cs.CR 57%

Backdoors in DRL: Four Environments Focusing on In-distribution Triggers

DRL中的后门:聚焦于分布内触发器的四个环境

Chace Ashcraft, Ted Staley, Josh Carney, Cameron Hickert, Derek Juba, Kiran Karra, Nathan Drenkow

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文针对深度强化学习中的后门攻击,通过四个环境探讨分布内触发器的特性与影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16989 2025-12-12 cs.LG 57%

Unveiling the Latent Directions of Reflection in Large Language Models

揭示大型语言模型中反思的潜在方向

Fu-Chieh Chang, Yu-Ting Lee, Pei-Yuan Wu

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 本文通过分析模型激活中的潜在方向,揭示了大型语言模型中反思机制的可控性及不同反思层次的区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14070 2025-11-27 cs.CR cs.AI 57%

Special-Character Adversarial Attacks on Open-Source Language Model

特殊字符对抗攻击对开源语言模型的攻击

Ephraiem Sarabamoun

机构 * University of Virginia(弗吉尼亚大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文研究了针对开源语言模型的特殊字符对抗攻击,评估了多种攻击方式并揭示了模型的安全漏洞及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17987 2025-11-24 cs.CR cs.AI cs.CV 57%

Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning

通过LLM推理进行文本到图像模型的劫持:Reason2Attack

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, An-An Liu

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 Reason2Attack通过将劫持攻击融入LLM后训练过程,提升生成对抗性提示的推理能力,实现更高效的文本到图像模型攻击

Comments Noted that This paper includes model-generated content that may contain offensive or distressing material

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12423 2025-11-18 cs.CR cs.LG 57%

GRAPHTEXTACK: A Realistic Black-Box Node Injection Attack on LLM-Enhanced GNNs

Jiaji Ma, Puja Trivedi, Danai Koutra

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.LG

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12149 2025-11-18 cs.CR cs.AI cs.CV 57%

AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models

Jiayu Li, Yunhan Zhao, Xiang Zheng, Zonghuan Xu, Yige Li, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Singapore Management University(新加坡管理大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06151 2025-11-13 cs.CR cs.AI 57%

Joint-GCG: Unified Gradient-Based Poisoning Attacks on Retrieval-Augmented Generation Systems

Haowei Wang, Rupeng Zhang, Junjie Wang, Mingyang Li, Yuekai Huang, Dandan Wang, Qing Wang

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06212 2025-11-11 cs.CR cs.AI 57%

RAG-targeted Adversarial Attack on LLM-based Threat Detection and Mitigation Framework

Seif Ikbarieh, Kshitiz Aryal, Maanak Gupta

机构 * Department of Computer Science(计算机科学系) Tennessee Tech University(田纳西科技大学) School of Interdisciplinary Informatics(跨学科信息学学院) University of Nebraska Omaha(内布拉斯加大学奥马哈分校)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23558 2025-11-07 cs.CR cs.AI 57%

Transferable & Stealthy Ensemble Attacks: A Black-Box Jailbreaking Framework for Large Language Models

Yiqi Yang, Hongye Fu

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03434 2025-11-06 cs.HC cs.AI cs.MA cs.NI cs.SI 57%

Inter-Agent Trust Models: A Comparative Study of Brief, Claim, Proof, Stake, Reputation and Constraint in Agentic Web Protocol Design-A2A, AP2, ERC-8004, and Beyond

Botao 'Amber' Hu, Helena Rong

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

Comments Submitted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02823 2025-11-05 cs.AI 57%

Optimizing AI Agent Attacks With Synthetic Data

Chloe Loughridge, Paul Colognese, Avery Griffin, Tyler Tracy, Jon Kutasov, Joe Benton

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00943 2025-11-03 cs.CR cs.AI 57%

LLMs Can Covertly Sandbag on Capability Evaluations Against Chain-of-Thought Monitoring

Chloe Li, Mary Phuong, Noah Y. Siegel

机构 * University College London(伦敦大学学院)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

Comments Accepted to IJCNLP-AACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03728 2025-10-28 cs.AI cs.HC 57%

PersonaTeaming: Exploring How Introducing Personas Can Improve Automated AI Red-Teaming

Wesley Hanwen Deng, Sunnie S. Y. Kim, Akshita Jha, Ken Holstein, Motahhare Eslami, Lauren Wilcox, Leon A Gatys

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07153 2025-10-22 cs.CR cs.AI 57%

Mind the Web: The Security of Web Use Agents

Avishag Shapira, Parth Atulbhai Gandhi, Edan Habler, Asaf Shabtai

机构 * Ben-Gurion University of the Negev, Israel(内盖夫本·古里安大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16794 2025-10-21 cs.CR cs.LG 57%

Black-box Optimization of LLM Outputs by Asking for Directions

Jie Zhang, Meng Ding, Yang Liu, Jue Hong, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院) University at Buffalo(布法罗大学) Bytedance, Security Research(字节跳动安全研究)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14845 2025-10-17 cs.LG cs.CV 57%

Backdoor Unlearning by Linear Task Decomposition

Amel Abdelraheem, Alessandro Favero, Gerome Bovet, Pascal Frossard

机构 * EPFL(苏黎世联邦理工学院) Cyber-Defence Campus, armasuisse(网络安全校园,armasuisse)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12575 2025-10-14 cs.CR cs.AI 57%

DemonAgent: Dynamically Encrypted Multi-Backdoor Implantation Attack on LLM-based Agent

Pengyu Zhu, Zhenhong Zhou, Yuanhe Zhang, Shilinlu Yan, Kun Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01444 2025-10-10 cs.CR cs.AI 57%

PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization

Aofan Liu, Lulu Tang, Ting Pan, Yuguo Yin, Bin Wang, Ao Yang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07192 2025-10-09 cs.LG 57%

Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples

Alexandra Souly, Javier Rando, Ed Chapman, Xander Davies, Burak Hasircioglu, Ezzeldin Shereen, Carlos Mougan, Vasilios Mavroudis, Erik Jones, Chris Hicks, Nicholas Carlini, Yarin Gal, Robert Kirk

机构 * UK AI Security Institute(英国人工智能安全研究所) Anthropic Alan Turing Institute(艾伦·图灵研究所) OATML, University of Oxford(OATML,牛津大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23882 2025-10-07 cs.AI cs.CR 57%

Quant Fever, Reasoning Blackholes, Schrodinger's Compliance, and More: Probing GPT-OSS-20B

Shuyi Lin, Tian Lu, Zikai Wang, Bo Wen, Yibo Zhao, Cheng Tan

机构 * Northeastern University(东北大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03204 2025-10-06 cs.CL 57%

FocusAgent: Simple Yet Effective Ways of Trimming the Large Context of Web Agents

Imene Kerboua, Sahar Omidi Shayegan, Megh Thakkar, Xing Han Lù, Léo Boisvert, Massimo Caccia, Jérémy Espinas, Alexandre Aussem, Véronique Eglin, Alexandre Lacoste

机构 * LIRIS - CNRS, INSA Lyon, Universite Claude Bernard Lyon 1(LIRIS - CNRS,INSA里昂,克劳德·贝尔纳大学里昂) Esker ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15420 2025-10-01 cs.CR cs.AI 57%

Silent Leaks: Implicit Knowledge Extraction Attack on RAG Systems through Benign Queries

Yuhao Wang, Wenjie Qu, Shengfang Zhai, Yanze Jiang, Zichen Liu, Yue Liu, Yinpeng Dong, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏