arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 537 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 537 篇

2604.16838 2026-05-12 cs.CR cs.AI cs.MA 57%

enclawed: A Configurable, Sector-Neutral Hardening Framework for Single-User AI Assistant Gateways

enclawed:一个可配置、无扇区偏见的单用户AI助手网关加固框架

Alfredo Metere

机构 * Metere Consulting, LLC(梅特尔咨询公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 enclawed为需要可验证的对等信任、默认拒绝外部连接、签名模块加载和可篡改审计追踪的部署提供加固框架,通过两种风味实现数据驱动的分类和高保证的对等认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08310 2026-05-12 cs.CR cs.AI 57%

WebTrap: Stealthy Mid-Task Hijacking of Browser Agents During Navigation

WebTrap: 隐秘的中任务劫持攻击浏览器代理在导航过程中的行为

Zhichao Liu, Wenbo Pan, Haining Yu, Ge Gao, Tianqing Zhu, Xiaohua Jia

机构 * Harbin Institute of Technology(哈尔滨工业大学) City University of Hong Kong(香港城市大学) City University of Macau(澳门城市大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 WebTrap通过多步骤指令融合引导实现浏览器代理在导航任务中的隐秘劫持,提升攻击成功率同时保持系统可用性。

Comments 31 pages, 4 figures, 10 tables. Code: https://github.com/liuyaojialiuyaojia/WebTrap

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03213 2026-05-08 cs.CR cs.AI 57%

When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI

当代理处理秘密:关于代理AI的保密计算调查

Javad Forough, Marios Kogias, Hamed Haddadi

机构 * Department of Computing Imperial College London London, United Kingdom(计算系帝国理工学院伦敦英国)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文探讨了代理AI中保密计算的应用,分析了六个TEE平台的设计,提出了基于代理的威胁模型,并指出了六个开放挑战,旨在为生产级代理AI提供安全基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24020 2026-04-28 cs.CR cs.AI 57%

Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents

Poster: ClawdGo: 内生安全意识训练用于自主AI代理

Jiaqi Li, Yang Zhao, Bin Sun, Yang Yu, Jian Chang, Lidong Zhai

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Network Management Center, China Mobile Group Liaoning Company Limited(中国移动集团辽宁公司网络管理中心) Tencent Security Xuanwu Lab(腾讯安全宣武实验室) China Unicom Online Information Technology Co., Ltd.(中国联通在线信息技术有限公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出ClawdGo框架,通过内生训练提升自主AI代理的安全意识,引入TLDT、ASAT、CSMA和SACP四种贡献,实验显示ASAT在16次会话中提升TLDT得分,CSMA保持完整收益,SACP在高训练代理中观察到精度-召回权衡。

Comments 4 pages, including 1 poster page. Poster abstract and poster version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08127 2026-04-28 cs.AI 57%

BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks

BlindGuard: 保护基于大语言模型的多智能体系统免受未知攻击

Rui Miao, Yixin Liu, Yili Wang, Xu Shen, Yue Tan, Yiwei Dai, Shirui Pan, Xin Wang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出BlindGuard,一种无需标注的多智能体系统防御方法,通过层次编码器和腐蚀引导检测器有效检测多种攻击类型,优于监督基线。

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19657 2026-04-22 cs.CR cs.AI cs.OS 57%

An AI Agent Execution Environment to Safeguard User Data

一个保障用户数据安全的AI代理执行环境

Robert Stanley, Avi Verma, Lillian Tsai, Konstantinos Kallas, Sam Kumar

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Google(谷歌)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 GAAP通过动态用户提示收集权限规范,确保AI代理在共享用户隐私数据时符合规定,无需信任代理或模型,有效阻止数据泄露攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06922 2026-04-22 cs.CR cs.LG 57%

Whispers in the Machine: Confidentiality in Agentic Systems

机器中的低语:代理系统中的保密性

Jonathan Evertz, Merlin Chlosta, Lea Schönherr, Thorsten Eisenhofer

机构 * CISPA Helmholtz Center for Information Security(信息安全勒内希特中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 研究探讨了基于大语言模型的代理系统中的保密性问题,通过抽象敏感数据为秘密字符串,评估了十种代理在20种工具场景和14种攻击策略下的安全性,发现所有代理均存在至少一种漏洞,现有防御措施无法有效防止数据泄露。

Comments Accepted at Conference on Detection of Intrusions and Malware & Vulnerability Assessment (DIMVA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28166 2026-04-21 cs.CR cs.AI 57%

Evaluating Privilege Usage of Agents with Real-World Tools

评估具有现实工具的代理的特权使用

Quan Zhang, Lianhang Fu, Lvsi Lian, Gwihwan Go, Yujue Wang, Chijin Zhou, Yu Jiang, Geguang Pu

机构 * Xinjiang University(新疆大学) Tsinghua University(清华大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出GrantBox,一个用于评估代理特权使用的安全沙盒,通过集成真实工具和允许LLM代理调用真实特权,评估代理在提示注入攻击下的安全能力,发现LLM在面对复杂攻击时平均攻击成功率高达84.80%。

Comments Accepted to the FSE 2026 Ideas, Visions, and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09093 2026-04-13 cs.CR cs.CL 57%

Exploiting Web Search Tools of AI Agents for Data Exfiltration

利用AI代理的网络搜索工具进行数据外泄

Dennis Rall, Bernhard Bauer, Mohit Mittal, Thomas Fraunholz

机构 * Open Hippo GmbH(Open Hippo有限公司) University of Augsburg(奥格斯堡大学) Smart Labs AI GmbH(Smart Labs AI有限公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 研究分析了AI代理通过网络搜索工具进行数据外泄的攻击方式,探讨了模型大小、制造商及实现方式对漏洞的影响,并提出加强训练、建立攻击向量数据库和统一测试框架等安全措施。

Comments 9 pages, 6 figures, conference article

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03870 2026-04-07 cs.CL 57%

Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs

你的代理比你想象的更脆弱:揭示代理LLM中的间接注入漏洞

Wenhui Zhu, Xuanzhao Dong, Xiwen Chen, Rui Cai, Peijie Qiu, Zhipeng Wang, Oana Frunza, Shao Tang, Jindong Gu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Morgan Stanley(摩根士丹利) UC Davis(加州大学戴维斯分校) Washington University in St. Louis(圣路易斯华盛顿大学) Rice University(莱斯大学) Florida State University(佛罗里达州立大学) University of Oxford(牛津大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 研究揭示了代理LLM在动态环境中存在严重的间接注入漏洞,通过评估六种防御策略发现现有防护不足,提出基于表示工程的检测方法以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23064 2026-04-07 cs.CR cs.AI cs.SI 57%

Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution

注意你的HEARTBEAT!Claw背景执行本质上使内存污染静默

Yechao Zhang, Shiqian Zhao, Jie Zhang, Gelei Deng, Jiawen Zhang, Xiaogeng Liu, Chaowei Xiao, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局(A*STAR)) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究揭示Claw个人AI代理中因心跳驱动背景执行导致的内存污染漏洞,通过MissClaw实验发现社会可信度驱动行为影响,内存污染可进入长期记忆并影响用户行为。

Comments 26 pages, 6 figures, 7 tables; identifies a vulnerability in the heartbeat mechanism of Claw systems with version-scoped evaluation (pre-fix OpenClaw, February 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16934 2026-04-07 cs.CL 57%

In-Context Watermarks for Large Language Models

上下文水印用于大型语言模型

Yepeng Liu, Xuandong Zhao, Christopher Kruegel, Dawn Song, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) UC Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 本文提出In-Context Watermarking方法,通过提示工程在生成文本中嵌入水印,无需访问解码过程,适用于检测AI生成内容,验证了其作为通用且实用的水印方法的可行性。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24203 2026-03-26 cs.CR cs.AI 57%

Invisible Threats from Model Context Protocol: Generating Stealthy Injection Payload via Tree-based Adaptive Search

基于模型上下文协议的隐形威胁:通过树状自适应搜索生成隐蔽注入负载

Yulin Shen, Xudong Pan, Geng Hong, Min Yang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) IEEE Publication Technology Group(IEEE出版技术组)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出TIP攻击方法,通过树状结构搜索生成隐蔽负载,有效攻击MCP增强代理,实验显示其在未防御环境下攻击成功率超95%,且优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18063 2026-03-20 cs.CR cs.AI 57%

MCP-38: A Comprehensive Threat Taxonomy for Model Context Protocol Systems (v1.0)

MCP-38:一种针对模型上下文协议系统的全面威胁分类

Yi Ting Shen, Kentaroh Toyoda, Alex Leung

机构 * Vulcan Research(Vulcan研究院) AIFT

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出MCP-38,一种针对模型上下文协议系统的威胁分类体系,包含38个威胁类别,通过系统化方法覆盖MCP特有的语义攻击面。

Comments v1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17639 2026-03-19 cs.AI 57%

VeriGrey: Greybox Agent Validation

VeriGrey:灰盒代理验证

Yuntong Zhang, Sungmin Kang, Ruijie Meng, Marcel Böhme, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出VeriGrey方法,通过工具调用序列反馈函数驱动测试过程,发现LLM代理中隐含的提示注入漏洞,并在实际案例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15772 2026-03-13 cs.DL cs.AI cs.CR 57%

Detecting LLM-Generated Peer Reviews

检测由大语言模型生成的同行评审

Vishisht Rao, Aounon Kumar, Himabindu Lakkaraju, Nihar B. Shah

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种通过间接提示注入在同行评审中嵌入隐蔽水印的方法,用于检测由大语言模型生成的评审,该方法具有强统计保证并能有效应对常见防御措施。

Comments 27 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11619 2026-03-13 cs.CR cs.AI 57%

Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats

驯服OpenClaw:自主LLM代理威胁的分析与缓解

Xinhao Deng, Yixiang Zhang, Jiaqing Wu, Jiaqi Bai, Sibo Yi, Zhuoheng Zou, Yue Xiao, Rennai Qiu, Jianan Ma, Jialuo Chen, Xiaohu Du, Xiaofang Yang, Shiwen Cui, Changhua Meng, Weiqiang Wang, Jiaxing Song, Ke Xu, Qi Li

机构 * Ant Group & Tsinghua University(蚂蚁集团与清华大学) Tsinghua University(清华大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文分析了自主LLM代理OpenClaw的安全威胁,提出五层安全框架,揭示现有防御机制的不足,并提出包括插件审查、上下文过滤等在内的综合防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12594 2026-03-05 cs.CR cs.LG 57%

ceLLMate: Sandboxing Browser AI Agents

ceLLMate: 浏览器级沙箱框架

Luoxi Meng, Henry Feng, Ilia Shumailov, Earlence Fernandes

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 ceLLMate通过在HTTP层实现浏览器级沙箱化,有效防止浏览器代理中的提示注入攻击,同时保持较低的延迟开销。

Comments Homepage: https://cellmate-sandbox.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00472 2026-03-03 cs.AI cs.SE 57%

From Goals to Aspects, Revisited: An NFR Pattern Language for Agentic AI Systems

从目标到方面,重新审视:面向智能体AI系统的NFR模式语言

Yijun Yu

机构 * The Open University(开放大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出面向智能体AI系统的NFR模式语言,通过目标驱动的方法系统发现和模块化交叉切面问题,提升系统可靠性。

Comments 12 pages, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20156 2026-02-26 cs.CR cs.LG 57%

Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks

Skill-Inject: 评估代理对技能文件攻击的脆弱性

David Schmotz, Luca Beurer-Kellner, Sahar Abdelnabi, Maksym Andriushchenko

机构 * Max Planck Institute for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(马克斯·普朗克智能系统研究所、图宾根ELLIS研究所、图宾根人工智能中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 SkillInject通过评估代理对技能文件攻击的脆弱性,揭示了当前LLM代理在安全性和合规性方面的严重问题,指出需采用上下文感知的授权框架来提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23519 2026-02-17 cs.CR cs.AI 57%

ReliabilityRAG: Effective and Provably Robust Defense for RAG-based Web-Search

ReliabilityRAG: 有效且可证明的防御方法用于基于检索的Web搜索

Zeyu Shen, Basileal Imana, Tong Wu, Chong Xiang, Prateek Mittal, Aleksandra Korolova

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Center for Information Technology Policy(信息政策中心) Department of Electrical and Computer Engineering(电气与计算机工程系) NVIDIA(英伟达)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 ReliabilityRAG通过利用文档可靠性信息,提供更有效且可证明鲁棒的防御方法,以增强基于检索的Web搜索系统对对抗攻击的抵御能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11416 2026-02-13 cs.CR cs.LG 57%

Optimizing Agent Planning for Security and Autonomy

优化安全与自主性的智能体规划

Aashish Kolluri, Rishi Sharma, Manuel Costa, Boris Köpf, Tobias Nießen, Mark Russinovich, Shruti Tople, Santiago Zanella-Béguelin

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 本文提出了一种安全意识智能体,通过增强人工监督交互和规划任务进展与政策合规性,提高自主性并减少对人工监督的依赖。

Comments 33 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06914 2026-02-10 cs.CR cs.AI 57%

SoK: Trust-Authorization Mismatch in LLM Agent Interactions

SoK:LLM代理交互中的信任-授权不匹配

Guanquan Shi, Haohua Du, Zhiqiang Wang, Xiaoyu Liang, Weiwenpei Liu, Song Bian, Zhenyu Guan

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过B-I-P框架系统分析LLM代理交互中的信任-授权不匹配问题,揭示了动态信任与静态授权之间的脱节,并提出动态风险适应性授权的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07398 2026-02-10 cs.CR cs.AI 57%

AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management

AgentSys: 通过显式分层内存管理实现安全且动态的LLM代理

Ruoyao Wen, Hao Li, Chaowei Xiao, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 AgentSys通过显式分层内存管理有效防御间接提示注入攻击,显著降低攻击成功率并提升LLM代理的安全性和动态性。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21057 2026-01-21 cs.CR cs.LG 57%

Soft Instruction De-escalation Defense

软指令缓解防御

Nils Philipp Walter, Chawin Sitawarin, Jamie Hayes, David Stutz, Ilia Shumailov

机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全研究中心) Google DeepMind(谷歌DeepMind) AI Sequrity Company(AI安全公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 SIC通过迭代提示净化循环,有效防御LLM在智能体系统中受到提示注入攻击,尽管存在局限性,但提升了系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06416 2026-01-15 cs.AI cs.HC 57%

Advancing AI Negotiations: A Large-Scale Autonomous Negotiation Competition

推进人工智能谈判:大规模自主谈判竞赛

Michelle Vaccaro, Michael Caosun, Harang Ju, Sinan Aral, Jared R. Curhan

机构 * MIT Sloan School of Management(麻省理工学院斯隆管理学院) Johns Hopkins Carey Business School(约翰霍普金斯大学卡里商学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过大规模自主谈判竞赛发现,温暖特质在AI谈判中表现优异,主导策略在价值争夺中有效,需建立新的AI谈判理论以优化代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06403 2026-01-13 cs.CL 57%

Steer Model beyond Assistant: Controlling System Prompt Strength via Contrastive Decoding

超越助手的引导模型:通过对比解码控制系统提示强度

Yijiang River Dong, Tiancheng Hu, Zheng Hui, Nigel Collier

机构 * University of Cambridge(剑桥大学)

专题命中 提示注入 :alignment(abstract);分类 cs.CL

AI总结 通过对比解码控制系统提示强度,提升模型在复杂指令下的引导能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12488 2025-12-16 cs.CL 57%

The American Ghost in the Machine: How language models align culturally and the effects of cultural prompting

机器中的美国幽灵:语言模型如何实现文化对齐以及文化提示的影响

James Luther, Donald Brown

机构 * School of Data Science University of Virginia(数据科学学院 多伦多大学)

专题命中 提示注入 :alignment(abstract);分类 cs.CL

AI总结 本研究通过文化提示测试了多种LLM对不同文化适应性,发现多数模型默认倾向美国,但对日本和中国文化对齐存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19727 2025-11-26 cs.CR cs.AI 57%

Prompt Fencing: A Cryptographic Approach to Establishing Security Boundaries in Large Language Model Prompts

提示围栏:一种通过密码学建立大语言模型提示安全边界的方案

Steven Peh

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 Prompt Fencing通过密码学方法在LLM提示中建立安全边界,有效防止提示注入攻击。

Comments 44 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19569 2025-11-26 cs.LG 57%

An Invariant Latent Space Perspective on Language Model Inversion

语言模型反向的不变潜在空间视角

Wentao Ye, Jiaqi Hu, Haobo Wang, Xinpeng Ti, Zhiqing Xiao, Hao Chen, Liyao Li, Lei Feng, Sai Wu, Junbo Zhao

专题命中 提示注入 :alignment(abstract);分类 cs.LG

AI总结 本文提出Inv^2A方法,通过不变潜在空间假设提升语言模型反向性能,有效对抗隐私和安全威胁。

Comments The Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏