arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1730 篇

2604.03081 2026-04-06 cs.CR cs.AI cs.CL 62%

Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems

针对LLM编码代理技能生态系统的供应链污染攻击

Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma

机构 * Griffith University(格里菲斯大学) The State Information Center(国家信息中心) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Wake Forest University(维克森林大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM编码代理技能生态系统中供应链攻击对行动空间的影响,提出DDIPE方法通过嵌入恶意逻辑到技能文档中实现隐式payload执行,实验显示其在强防御下可绕过11.6%-33.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02954 2026-04-06 cs.CL cs.AI 62%

LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation

逻辑毒药:图检索增强生成中的逻辑攻击

Yilin Xiao, Jin Chen, Qinggang Zhang, Yujing Zhang, Chuang Zhou, Longhao Yang, Lingfei Ren, Xin Yang, Xiao Huang

机构 * Southwestern University of Finance and Economics(西南财经大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicPoison攻击框架,通过逻辑推理而非注入虚假内容,破坏图检索增强生成系统中的拓扑结构,从而降低其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27522 2026-03-31 cs.CL cs.CR cs.LG 62%

Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models

隐性广告:用于视觉语言模型中广告注入的行为触发语义后门

Duanyi Yao, Changyue Li, Zhicong Huang, Cheng Hong, Songze Li

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 本文提出隐性广告攻击,通过用户行为触发在视觉语言模型中注入未经授权的广告,利用自然用户行为实现高效且隐蔽的广告注入,同时评估了不同防御方法的失效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22341 2026-03-25 cs.CR cs.AI cs.CL 62%

T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

T-MAP: 通过轨迹感知的进化搜索实现红队攻击LLM代理

Hyomin Lee, Sangwoo Park, Yumin Choi, Sohyun An, Seanie Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出T-MAP方法,通过轨迹感知的进化搜索发现对抗性提示,有效突破安全防护并实现有害目标,实验显示其在攻击实现率上优于基线方法,适用于多步骤工具执行的LLM代理安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20976 2026-03-24 cs.LG cs.AI cs.HC 62%

Detection of adversarial intent in Human-AI teams using LLMs

利用大语言模型检测人类-人工智能团队中的对抗意图

Abed K. Musaffar, Ambuj Singh, Francesco Bullo

机构 * Department of Mechanical Engineering, University of California at Santa Barbara(加州大学圣巴巴拉分校机械工程系) Department of Computer Science, University of California at Santa Barbara(加州大学圣巴巴拉分校计算机科学系)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型在人类-人工智能团队中作为防御监督者的潜力,通过分析交互痕迹检测恶意行为,发现LLM能实时识别恶意行为,且无需任务特定信息,表明了任务无关防御的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19247 2026-03-23 cs.CL cs.AI 62%

When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models

当提示优化成为劫持:大型语言模型的自适应红队测试

Zafir Shamsi, Nikhil Chekuru, Zachary Guzman, Shivank Garg

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在对抗性提示优化下的安全性漏洞,通过自适应红队测试发现开源小模型的安全保障显著降低,表明静态评估无法准确反映真实风险。

Comments EACL SRW 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10080 2026-03-18 cs.CR cs.AI cs.LG 62%

Amnesia: Adversarial Semantic Layer Specific Activation Steering in Large Language Models

遗忘:大型语言模型中的对抗性语义层特定激活引导

Ali Raza, Gurang Gupta, Nikolay Matyunin, Jibesh Patra

机构 * Honda Research Institute Europe(本田欧洲研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Amnesia攻击,通过操纵transformer内部状态绕过开放式大语言模型的安全机制,展示其能生成有害内容而无需微调。研究强调了对开放式大语言模型安全性的迫切需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09462 2026-03-03 cs.LG cs.AI cs.CR 62%

Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols

对可信监控的自适应攻击颠覆AI控制协议

Mikhail Terekhov, Alexander Panfilov, Daniil Dzenhaliou, Caglar Gulcehre, Maksym Andriushchenko, Ameya Prabhu, Jonas Geiping

机构 * MATS EPFL(瑞士联邦理工学院) ELLIS Institute Tübingen & Max Planck Institute for Intelligent Systems(图宾根ELLIS研究所及图宾根马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) University of Tübingen(图宾根大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文提出针对AI控制协议中监控模型的自适应攻击方法,通过嵌入提示注入技术规避监控并完成恶意任务,揭示了当前控制协议的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17837 2026-02-23 cs.CR cs.CL cs.LG 62%

TFL: Targeted Bit-Flip Attack on Large Language Model

TFL:针对大语言模型的定向位翻转攻击

Jingkai Guo, Chaitali Chakrabarti, Deliang Fan

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG

AI总结 TFL是一种新型定向位翻转攻击框架,通过精确操控LLM输出并减少对无关输入的影响,提升攻击的隐蔽性和针对性。

Comments 13 pages, 11 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00038 2026-02-12 cs.CL cs.AI cs.CR 62%

from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors

从无害到有害:通过对抗隐喻 jailbreak 语言模型

Yu Yan, Sheng Sun, Zenghao Duan, Teli Liu, Min Liu, Zhiyi Yin, Jingyu Lei, Qi Li

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学) Tsinghua University(清华大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 通过对抗隐喻诱导语言模型生成有害内容,提出AVATAR框架以提升jailbreak攻击效果。

Comments arXiv admin note: substantial text overlap with arXiv:2412.12145

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08859 2026-02-06 cs.CL cs.AI cs.CR 62%

Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models

模式增强的多轮劫持:在大语言模型中利用结构漏洞

Ragib Amin Nihal, Rui Wen, Kazuhiro Nakadai, Jun Sakuma

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PE-CoA框架,通过五个对话模式构建多轮劫持攻击,揭示了大语言模型在不同危害类别下的漏洞及防御局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02395 2026-02-03 cs.LG cs.AI cs.CR cs.MA 62%

David vs. Goliath: Verifiable Agent-to-Agent Jailbreaking via Reinforcement Learning

大卫与歌利亚:通过强化学习实现可验证的代理到代理劫持

Samuel Nellessen, Tal Kachman

机构 * Department of Artificial Intelligence, Radboud University, Nijmegen, The Netherlands(人工智能系,拉德堡德大学,尼姆韦根,荷兰)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过强化学习框架Slingshot,验证了Tag-Along攻击作为可验证的威胁模型,并展示了如何通过环境交互从现成模型中引发有效代理攻击。

Comments Under review. 8 main pages, 2 figures, 2 tables. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19375 2026-01-28 cs.LG cs.AI 62%

Selective Steering: Norm-Preserving Control Through Discriminative Layer Selection

选择性引导:通过判别层选择实现的范数保持控制

Quy-Anh Dang, Chris Ngo

机构 * VNU University of Science(越南国家科学大学) Knovel Engineering Lab(Knovel工程实验室)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 选择性引导通过判别层选择和范数保持旋转,实现对LLM行为的可控稳定修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03420 2026-01-08 cs.LG cs.AI cs.CR 62%

Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks

无需梯度或先验知识的LLM劫持:有效且可转移的攻击

Zhakshylyk Nurlanov, Frank R. Schmidt, Florian Bernard

机构 * Department of Visual Computing, University of Bonn(视觉计算系,波恩大学) Bosch Center for Artificial Intelligence(博世人工智能中心) University of Bonn(波恩大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 RAILS通过无需梯度或先验知识的令牌级迭代优化,实现了对LLM的有效且可转移的对抗性攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00867 2026-01-06 cs.CR cs.AI cs.CY cs.HC 62%

The Silicon Psyche: Anthropomorphic Vulnerabilities in Large Language Models

硅之心:大型语言模型中的人格化脆弱性

Giuseppe Canale, Kashyap Thimmaraju

机构 * CPF3.org(CPF3组织) Flowguard Institute(Flowguard研究所)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI、cs.CY

AI总结 本文提出LLMs继承人类心理脆弱性,通过心理测量框架揭示其对权威操纵等攻击的易受性,呼吁开发心理防火墙以保护AI安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16962 2025-12-22 cs.CR cs.AI cs.LG 62%

MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval

MemoryGraft: 通过中毒经验检索持续破坏LLM代理

Saksham Sahai Srivastava, Haoyu He

机构 * School of Computing University of Georgia(计算机学院 佐治亚大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 MemoryGraft 通过在LLM代理的长期记忆中植入恶意经验,实现对代理行为的持续破坏。

Comments 14 pages, 1 figure, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15081 2025-12-18 cs.CR cs.AI cs.CL 62%

Quantifying Return on Security Controls in LLM Systems

对LLM系统中安全控制的回报进行量化

Richard Helder Moulton, Austin O'Brien, John D. Hastings

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种量化LLM系统安全控制回报的方法,通过模拟攻击和风险评估,比较了ABAC、NER删除和NeMo Guardrails三种安全措施的效果,发现ABAC显著降低风险,RoC达到9.83。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16689 2025-12-16 cs.CL cs.AI 62%

Concept-Based Interpretability for Toxicity Detection

基于概念的可解释性用于毒性检测

Samarth Garg, Divya Singh, Deeksha Varshney, Mamta

机构 * ABV–IIITM(ABV-IIITM) IIT Patna(印度帕纳大学) IIT Jodhpur(印度朱道普尔大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于概念梯度的方法,通过分析有毒语言的归因机制,改进毒性检测的可解释性和准确性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17904 2025-12-16 cs.CR cs.AI cs.CL 62%

BreakFun: Jailbreaking LLMs via Schema Exploitation

BreakFun: 通过模式利用对LLM进行劫持

Amirkia Rafiei Oskooei, Mehmet S. Aktas

机构 * Department of Computer Engineering, Yildiz Technical University(计算机工程系,伊兹密尔技术大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 BreakFun通过利用LLM对结构模式的遵守能力,揭示了其在劫持攻击中的脆弱性,并提出对抗性提示解构作为缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12648 2025-11-18 cs.CR cs.AI cs.LG 62%

Scalable Hierarchical AI-Blockchain Framework for Real-Time Anomaly Detection in Large-Scale Autonomous Vehicle Networks

Rathin Chandra Shit, Sharmila Subudhi

机构 * organization= Dept. of Computer Science \& Engg., International Institute of Information Technology , city= Bhubaneswar , postcode= 751003 , state= Odisha , country= India organization= Dept. of Computer Science, Maharaja Sriram Chandra Bhanja Deo University , city= Baripada , postcode= 757003 , state= Odisha , country= India

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

Comments Submitted to the Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10088 2025-11-14 cs.LG cs.AI cs.CV 62%

eXIAA: eXplainable Injections for Adversarial Attack

Leonardo Pesce, Jiawen Wei, Gianmarco Mengaldo

机构 * Department of Mechanical Engineering National University of Singapore(机械工程系国立新加坡大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08597 2025-11-13 cs.CL cs.AI 62%

Self-HarmLLM: Can Large Language Model Harm Itself?

Heehwan Kim, Sungjune Park, Daeseon Choi

机构 * Soongsil University(首尔大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03299 2025-11-10 cs.LG cs.CL cs.CV 62%

GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models

Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Haohan Wang

机构 * School of Information Sciences University of Illinois at Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校) Independent Researcher, Starc Institute(Starc研究所独立研究者) Computer Science and Engineering HKUST(HKUST计算机科学与工程学院) Computer Science Lapis Labs University of Illinois Urbana-Champaign(计算机科学Lapis Labs伊利诺伊大学厄巴纳-香槟分校) School of Information Sciences University of Illinois Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG

Comments 28 papges

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19360 2025-10-21 cs.CL cs.AI 62%

Semantic Representation Attack against Aligned Large Language Models

Jiawei Lian, Jianhong Pan, Lefan Wang, Yi Wang, Shaohui Mei, Lap-Pui Chau

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) School of Electronics and Information, Northwestern Polytechnical University(西北工业大学电子与信息学院)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19304 2025-10-21 cs.CY cs.AI cs.CE 62%

Epistemic Trade-Off: An Analysis of the Operational Breakdown and Ontological Limits of "Certainty-Scope" in AI

Generoso Immediato

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.CY

Comments Preprint V3 (October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10601 2025-10-15 cs.CL cs.AI 62%

When "Competency" in Reasoning Opens the Door to Vulnerability: Jailbreaking LLMs via Novel Complex Ciphers

Divij Handa, Zehua Zhang, Amir Saeidi, Shrinidhi Kumbhar, Md Nayem Uddin, Aswin RRV, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

Comments Published in Reliable ML from Unreliable Data workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21947 2025-10-07 cs.LG cs.AI 62%

Active Attacks: Red-teaming LLMs via Adaptive Environments

Taeyoung Yun, Pierre-Luc St-Charles, Jinkyoo Park, Yoshua Bengio, Minsu Kim

机构 * KAIST(韩国科学技术院) Mila – Québec AI Institute(魁北克人工智能研究所) LawZero Omelet Université de Montréal(蒙特利尔大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

Comments 22 pages, 7 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13115 2025-10-01 cs.CL cs.AI cs.CR 62%

Dagger Behind Smile: Fool LLMs with a Happy Ending Story

Xurui Song, Zhixin Xie, Shuo Huai, Jiayi Kong, Jun Luo

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学新加坡分校S实验室) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17881 2025-09-30 cs.CL cs.AI 62%

GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication

Hua Tang, Lingyong Yan, Yukun Zhao, Shuaiqiang Wang, Jizhou Huang, Dawei Yin

机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) Baidu Inc.(百度公司)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19100 2025-09-24 cs.LG cs.AI 62%

Algorithms for Adversarially Robust Deep Learning

Alexander Robey

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏