arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1731 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1731 篇

2510.25941 2026-03-16 cs.CL 57%

RECAP: Reproducing Copyrighted Data from LLMs Training with an Agentic Pipeline

RECAP:通过代理流水线从LLM训练中重现受版权保护的数据

André V. Duarte, Xuying li, Bin Zeng, Arlindo L. Oliveira, Lei Li, Zhuo Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Instituto Superior Técnico/INESC-ID(里斯本技术大学/INESC-ID) Hydrox AI

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 RECAP通过代理流水线从LLM输出中提取和验证记忆的训练数据,利用反馈循环和对抗模块提升版权文本提取效果,实验显示其在ROUGE-L评分上显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10163 2026-03-12 cs.CR cs.AI 57%

Compatibility at a Cost: Systematic Discovery and Exploitation of MCP Clause-Compliance Vulnerabilities

兼容性代价:系统性发现和利用MCP条款合规性漏洞

Nanzi Yang, Weiheng Bai, Kangjie Lu

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出首个系统性框架,用于分析MCP条款合规性漏洞,通过构建中间表示、静态分析和攻击模式引导管道,发现并利用兼容性滥用攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10092 2026-03-12 cs.CR cs.AI 57%

Execution Is the New Attack Surface: Survivability-Aware Agentic Crypto Trading with OpenClaw-Style Local Executors

执行是新的攻击面:面向OpenClaw风格的生存意识代理加密交易

Ailiya Borjigin, Igor Stadnyk, Ben Bilski, Serhii Hovorov, Sofiia Pidturkina

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出SAE,一种针对OpenClaw风格系统的生存意识执行标准,通过定义执行合同和强制执行不变量,提高代理加密交易的生存能力。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11247 2026-03-09 cs.CR cs.AI 57%

Peak + Accumulation: A Proxy-Level Scoring Formula for Multi-Turn LLM Attack Detection

峰值+累积:多轮LLM攻击检测的代理层评分公式

J Alex Corll

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 提出一种基于峰值和累积的代理层评分公式,用于多轮LLM攻击检测,实现高召回率和低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08207 2026-03-04 cs.AI 57%

Toward a Dynamic Stackelberg Game-Theoretic Framework for Agentic AI Defense Against LLM Jailbreaking

面向动态Stackelberg博弈框架的代理AI防御对抗大语言模型劫持

Zhengye Han, Quanyan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出动态Stackelberg博弈框架,用于代理AI防御对抗大语言模型劫持,通过RRT搜索和博弈树分析提升防御效果。

Comments Accepted to ICLR 2026 AIMS Workshop. 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01574 2026-03-03 cs.CR cs.AI 57%

DualSentinel: A Lightweight Framework for Detecting Targeted Attacks in Black-box LLM via Dual Entropy Lull Pattern

DualSentinel: 一种用于通过双熵低谷模式检测黑盒LLM中针对性攻击的轻量级框架

Xiaoyi Pang, Xuanyi Hao, Pengyu Liu, Qi Luo, Song Guo, Zhibo Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) School of Cyber Science and Technology(网络安全科学与技术学院)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 DualSentinel通过双熵低谷模式检测黑盒LLM中的针对性攻击,提供高效且准确的防御方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01454 2026-03-03 cs.CV cs.AI 57%

VidDoS: Universal Denial-of-Service Attack on Video-based Large Language Models

VidDoS:针对基于视频的大语言模型的通用拒绝服务攻击

Duoxun Tang, Dasen Dai, Jiyao Wang, Xiao Yang, Jianyu Wang, Siqi Cai

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) Shenzhen Loop Area Institute, China(深圳环园院) McGill University(麦吉尔大学) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 VidDoS是一种针对视频大语言模型的通用拒绝服务攻击方法,通过通用优化生成实例无关的触发器,导致模型推理延迟和token扩展显著增加,引发安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00131 2026-03-03 cs.MA cs.AI 57%

Thought Virus: Viral Misalignment via Subliminal Prompting in Multi-Agent Systems

Thought Virus: 通过潜意识提示在多智能体系统中产生病毒性偏差

Moritz Weckbecker, Jonas Müller, Ben Hagag, Michael Mulet

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本研究揭示了多智能体系统中通过潜意识提示传播偏见的风险,指出单个智能体的潜意识提示可能影响整个网络的诚实性,提出新的安全攻击向量。

Comments 18 pages, 10 figures, 2 tables. Code available at https://github.com/Multi-Agent-Security-Initiative/thought_virus

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15897 2026-02-19 cs.CL 57%

Mitigating Gradient Inversion Risks in Language Models via Token Obfuscation

通过令牌混淆缓解语言模型中的梯度倒置风险

Xinguo Feng, Zhongkui Ma, Zihan Wang, Alsharif Abuadbba, Guangdong Bai

机构 * The University of Queensland(昆士兰大学) CSIRO's Data61(CSIRO的数据61部门) City University of Hong Kong(香港城市大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出GHOST机制,通过令牌混淆解耦梯度、嵌入和令牌空间的联系,有效缓解语言模型的梯度倒置风险,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14166 2026-02-17 cs.CR cs.AI 57%

IntentMiner: Intent Inversion Attack via Tool Call Analysis in the Model Context Protocol

IntentMiner: 通过模型上下文协议中的工具调用分析进行意图倒置攻击

Yunhao Yao, Zhiqiang Wang, Haoran Cheng, Yihang Cheng, Haohua Du, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 IntentMiner通过分析模型上下文协议中的工具调用,揭示了意图倒置攻击的机制,实现了超过85%的语义对齐,挑战了AI代理的隐私基础。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07139 2026-02-17 cs.CV cs.CR cs.LG 57%

Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning

图像能帮你找回记忆:一种新颖的多模态引导攻击对抗图像生成模型去学习

Renyang Liu, Guanlin Li, Tianwei Zhang, See-Kiong Ng

机构 * Institute of Data Science, National University of Singapore(数据科学研究所,新加坡国立大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 Recall提出一种新颖的多模态引导攻击框架,针对图像生成模型去学习的鲁棒性进行攻击,展示其在对抗有效性、计算效率和语义保真度上的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10222 2026-02-12 cs.SD cs.AI 57%

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard

针对多模态大语言模型的语音音频组合攻击及其通过SALMONN-Guard的缓解

Yudong Yang, Xuezhen Zhang, Zhifeng Han, Siyin Wang, Jimin Zhuang, Zengrui Jin, Jing Shao, Guangzhi Sun, Chao Zhang

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Cambridge(剑桥大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 针对多模态LLMs的安全性,提出SACRED-Bench评估语音音频组合攻击,并通过SALMONN-Guard将攻击成功率降低至20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02424 2026-02-10 cs.CR cs.AI cs.SE 57%

CyberRAG: An Agentic RAG cyber attack classification and reporting tool

CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具

Francesco Blefari, Cristian Cosentino, Francesco Aurelio Pironti, Angelo Furfaro, Fabrizio Marozzo

机构 * University of Calabria(卡利博里大学) IMT School for Advanced Studies(IMT高级研究学院)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。

Journal ref Future Generation Computer Systems, 176, 2026, 108186

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02542 2026-02-05 cs.LG cs.CR 57%

OverThink: Slowdown Attacks on Reasoning LLMs

OverThink: 对推理大语言模型的减速攻击

Abhinav Kumar, Jaechul Roh, Ali Naseh, Marzena Karpinska, Mohit Iyyer, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Simon Fraser University(西蒙弗雷泽大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 OverThink攻击通过注入伪装推理问题,迫使推理大语言模型消耗更多token,从而增加延迟和成本,同时探讨了其防御和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03365 2026-02-05 cs.SD cs.AI cs.CR eess.AS 57%

When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs

当良好声音变得对抗性:利用无害输入对音频-语言模型进行劫持

Hiskias Dingeto, Taeyoun Kwon, Dasol Choi, Bodam Kim, DongGeon Lee, Haon Park, JaeHoon Lee, Jongho Shin

机构 * Yonsei University, Seoul, South Korea(延世大学) Seoul National University, Seoul, South Korea(首尔国立大学) Pohang University of Science(坡桑科学大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 WhisperInject通过在无害音频中嵌入细微扰动,利用两阶段对抗性攻击框架劫持音频-语言模型,生成有害内容,展示了音频原生威胁的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10415 2026-02-04 cs.SE cs.AI 57%

How to Trick Your AI TA: A Systematic Study of Academic Jailbreaking in LLM Code Evaluation

如何欺骗你的AI助教:对LLM代码评估中学术劫持的系统研究

Devanshu Sahoo, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Dhruv Kumar

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文研究了学术情境中针对LLM代码评估器的劫持攻击,提出了一种新的攻击类型,并通过实验揭示了LLM在面对此类攻击时的脆弱性。

Comments This manuscript has been withdrawn by the authors because the methodology and results have been superseded by a more rigorous framework (SPACI and AST-ASIP). The corrected and expanded findings are now available in arXiv:2601.21360. Please cite the new manuscript instead

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19970 2026-01-29 cs.CR cs.LG 57%

Benchmarking LLAMA Model Security Against OWASP Top 10 For LLM Applications

根据OWASP Top 10为LLM应用程序的框架对LLAMA模型安全性能进行基准测试

Nourin Shahin, Izzat Alsmadi

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本研究通过对比不同LLama模型的安全性能,发现小型专用模型在威胁检测上表现优于大型通用模型,并提供开源数据集支持AI安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03495 2026-01-27 eess.SY cs.AI cs.SY 57%

Cyberattack Detection in Virtualized Microgrids Using LightGBM and Knowledge-Distilled Classifiers

在虚拟微电网中利用LightGBM和知识蒸馏分类器进行网络攻击检测

Osasumwen Cedric Ogiesoba-Eguakun, Suman Rath

机构 * The University of Tulsa(塔尔萨大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于LightGBM和知识蒸馏的轻量级机器学习方法,用于在虚拟微电网中高效检测网络攻击。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21155 2026-01-27 cs.CL 57%

Learning the Wrong Lessons: Syntactic-Domain Spurious Correlations in Language Models

学习错误的教训:语言模型中的语法-领域虚假相关性

Chantal Shaib, Vinith M. Suriyakumar, Levent Sagun, Byron C. Wallace, Marzyeh Ghassemi

机构 * Northeastern University(东北大学) MIT(麻省理工学院) Meta

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 研究揭示了语言模型中语法与领域之间的虚假相关性问题,指出训练数据中语法模板可能影响模型性能,并提出需测试此类相关性及确保训练数据多样性以防止错误学习。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19327 2026-01-27 cs.CV cs.AI 57%

DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding

DeepInsert: 早期层绕过以实现高效且高性能的多模态理解

Moulik Choraria, Xinbo Wu, Akhil Bhimaraju, Nitesh Sekhar, Yue Wu, Xu Zhang, Prateek Singhal, Lav R. Varshney

机构 * UIUC(伊利诺伊大学) Amazon(亚马逊) Capital One Apple(苹果) Stony Brook University(石溪大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 DeepInsert通过将多模态令牌插入模型中间层以绕过早期层,从而在降低训练和推理成本的同时保持或提升多模态语言模型的性能。

Comments To be presented at EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16466 2026-01-26 cs.CL 57%

Persona Jailbreaking in Large Language Models

大型语言模型中的身份劫持

Jivnesh Sandhan, Fei Cheng, Tushar Sandhan, Yugo Murawaki

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 PHISH通过隐含引导历史的身份劫持框架,揭示LLM身份操控的新漏洞,实现对身份的可控操控。

Comments Accepted at EACL26 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11020 2026-01-26 cs.CR cs.AI 57%

Data Poisoning Vulnerabilities Across Healthcare AI Architectures: A Security Threat Analysis

医疗AI架构中的数据中毒漏洞:安全威胁分析

Farhad Abtahi, Fernando Seoane, Iván Pau, Mario Vega-Barbas

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 医疗AI面临数据中毒威胁,需多层防御措施和可解释系统以提高安全性。

Journal ref J Med Internet Res 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15047 2026-01-21 cs.CL 57%

RainbowPlus: Enhancing Adversarial Prompt Generation via Evolutionary Quality-Diversity Search

RainbowPlus:通过进化质量-多样性搜索增强对抗性提示生成

Quy-Anh Dang, Chris Ngo, Truong-Son Hy

机构 * VNU University of Science(越南国家科学大学) Knovel Engineering Lab(Knovel工程实验室) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 RainbowPlus通过进化质量-多样性搜索提升对抗性提示生成,实现更高的攻击成功率和多样性,且运行效率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10407 2026-01-16 cs.LG 57%

CS-GBA: A Critical Sample-based Gradient-guided Backdoor Attack for Offline Reinforcement Learning

CS-GBA:一种基于关键样本的梯度引导后门攻击用于离线强化学习

Yuanjie Zhao, Junnan Qiu, Yue Ding, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学) SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英技术学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 CS-GBA提出了一种基于关键样本的梯度引导后门攻击方法,通过优化攻击预算和隐蔽性,有效对抗安全约束算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06305 2026-01-13 cs.CL 57%

Why LoRA Fails to Forget: Regularized Low-Rank Adaptation Against Backdoors in Language Models

为何LoRA无法遗忘:针对语言模型中的后门行为的正则化低秩适应

Hoang-Chau Luong, Lingwei Chen

机构 * Golisano College of Computing and Information Sciences(戈利萨诺计算与信息科学学院) Rochester Institute of Technology(罗切斯特理工大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 RoRA通过增强谱强度和纠正对齐,有效提升LoRA在对抗后门攻击时的遗忘能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05445 2026-01-12 cs.CR cs.LG 57%

Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models

基于知识的多轮对抗攻击大语言模型

Songze Li, Ruishi He, Xiaojun Jia, Jun Wang, Zhihui Fu

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) OPPO Research Institute(OPPO研究院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 Mastermind通过动态知识库和分层规划架构,实现对大语言模型的高效多轮对抗攻击,显著提升攻击效果和防御韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05339 2026-01-12 cs.CR cs.AI 57%

Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models

多轮劫持攻击在多模态大语言模型中的应用

Badhan Chandra Das, Md Tasnim Jawad, Joaquin Molto, M. Hadi Amini, Yanzhao Wu

机构 * Knight Foundation School of Computing and Information Science, Florida International University(骑士基金会计算与信息科学学院,佛罗里达国际大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出多轮劫持攻击及FragGuard防御机制,评估其在多模态大语言模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04034 2026-01-08 cs.CR cs.AI 57%

HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense

HoneyTrap: 通过坚韧的多智能体防御欺骗大语言模型攻击者以诱捕陷阱

Siyuan Li, Xi Lin, Jun Wu, Zehao Liu, Haoyu Li, Tianjie Ju, Xiang Chen, Jianhua Li

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 HoneyTrap通过多智能体协作防御机制,有效降低大语言模型劫持攻击的成功率,提升防御效率与资源消耗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01211 2026-01-08 cs.CR cs.AI cs.MA 57%

Web Fraud Attacks Against LLM-Driven Multi-Agent Systems

针对基于大语言模型的多智能体系统 的网络欺诈攻击

Dezhang Kong, Hujin Peng, Yilun Zhang, Lele Zhao, Zhenhua Xu, Shi Lin, Changting Lin, Meng Han

机构 * Zhejiang University(浙江大学) Changsha University of Science and Technology(长沙理工大学) Purdue University(普渡大学) University of California San Diego(加州大学圣地亚哥分校) Zhejiang Gongshang University(浙江工商大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种针对基于大语言模型的多智能体系统的新攻击类型,通过网络链接的独特结构欺骗系统,展示了其在不同架构中的破坏潜力及逃避优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02110 2026-01-08 cs.AI 57%

Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools

吸引性元数据攻击:诱导LLM代理调用恶意工具

Kanghua Mo, Li Hu, Yucheng Long, Zhihao Li

机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间研究院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本研究提出AMA攻击,通过操纵工具元数据诱导LLM代理调用恶意工具,揭示了系统性安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏