arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 537 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 537 篇

2404.13208 2024-04-23 cs.CR cs.CL cs.LG 62%

The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions

Eric Wallace, Kai Xiao, Reimar Leike, Lilian Weng, Johannes Heidecke, Alex Beutel

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30837 2026-06-16 cs.CR cs.LG 版本更新 61%

Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

先派侦察兵:提示注入防御中自适应检测器分配的预推理方法

Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie

机构 * UC San Diego(加州大学圣迭戈分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :safety(abstract,comments);分类 cs.LG

AI总结 针对提示注入检测器异构且不可靠的问题,提出SCOUT框架,通过预测每个检测器对每个样本的可靠性和延迟,动态分配检测器,实现安全性与效率的权衡。

Comments We propose SCOUT, a detector allocation framework that predicts each detector's accuracy and latency on a given input before running it, letting operators control the safety-utility trade-off with a single threshold and route to an LLM judge only when needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04653 2026-05-26 cs.CR cs.LG 61%

Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise

通过聊天模板的推理时后门:从LLM供应链到代理系统妥协

Ariel Fogel, Omer Hofman, Eilon Cohen, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG;trustworthy(comments)

AI总结 提出一种通过恶意修改聊天模板实现推理时后门攻击的方法,无需修改模型权重或训练数据,在LLM、代理和多代理系统层面均能成功攻击,且能绕过现有防御。

Comments V3: Accepted to ICLR 2026 Trustworthy AI Workshop, V4: Submitted to CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21230 2026-08-24 cs.CR cs.AI 新提交 57%

Utility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking

受攻击下的效用:智能体记忆投毒及内容筛选与来源排序的局限性

Arulnidhi Karunanidhi

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 该研究针对智能体记忆投毒问题,测试了内容筛选和来源排序的防御效果,发现仅内容筛选无法抵御投毒,来源加权检索也存在局限,主张采用有限占用约束并发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16178 2026-08-18 cs.DC cs.AI 新提交 57%

Agent-Native Telemetry: Verifiable State-Delta Evidence for Autonomous Operations

智能体原生遥测:面向自主操作的可验证状态增量证据

Jun He, Deying Yu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 该研究提出智能体原生遥测架构,基于ATP协议和状态增量证据账本,在微服务基准测试中大幅降低了数据开销、LLM资源消耗,且能检测对抗性突变、抵御提示注入攻击。

Comments 13 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15888 2026-08-18 cs.AI cs.CR 新提交 57%

Bounded Agents: Delegation Security for Multi-Agent AI Systems

有界智能体:多智能体AI系统的委托安全

Xabier Muruaga

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 该研究针对多智能体AI系统的委托安全问题,提出智能体委托链(APC)架构,经实验可有效阻止提示注入攻击,降低数据窃取、破坏及操纵风险,授权延迟低且效用损失可控。

Comments 14 pages, 4 figures, 18 tables. Code and data: https://github.com/xmuruaga/bounded-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06850 2026-08-18 cs.CR cs.AI 57%

The Dark Side of LLMs: Agent-based Attack Vectors for System-level Compromise

大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵

Matteo Lupinacci, Francesco Aurelio Pironti, Francesco Blefari, Francesco Romeo, Luigi Arena, Angelo Furfaro

机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11803 2026-08-13 cs.CY 新提交 57%

Silent Updates: Measuring and Closing the Post-Deployment Disclosure Gap

静默更新:测量并弥合部署后的披露差距

Sophia Abraham, Ben Bucknall

专题命中 提示注入 :safety(abstract);分类 cs.CY

AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。

Comments Accepted to AIES-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08468 2026-08-11 cs.CR cs.AI 新提交 57%

SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills

SkillsMetric:映射恶意智能体技能静态分析的检测边界

Xinze Chen, Chi Zhang, Ping Ji, Yimin Liu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。

Comments 6 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05430 2026-08-07 cs.CR cs.LG 新提交 57%

Robust Context-Aware Detection of Malicious Instructions in Text

文本中恶意指令的鲁棒上下文感知检测

Buzhao Liu, Xinhang Ma, Yevgeniy Vorobeychik

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 该研究针对LLM易受间接提示注入攻击的问题,提出上下文感知的恶意句子分类方法及两种对抗训练技术,在静态和自适应攻击下均提升了IPI防御性能,且需根据领域调整参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03239 2026-08-05 cs.CL 新提交 57%

Relational Priors as Convergence Pressure in LLM-Based Multi-Agent Systems

关系先验作为基于大语言模型的多智能体系统中的收敛压力

Ming Shen, Chao Shang, Sadat Shahriar, Devang Kulshreshtha, Yi Zhang, Sandesh Swamy, Yanjun Qi

专题命中 提示注入 :alignment(abstract);分类 cs.CL

AI总结 该研究将关系先验注入LLM-MAS提示中,发现其主要起收敛压力作用,正向性提升可促进智能体协调但未必提高准确性,建议按需使用而非默认添加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-05 cs.CR cs.AI 新提交 57%

Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Xu Peng, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23532 2026-08-03 cs.CR cs.AI cs.LO cs.RO 版本更新 57%

Mission-Level Runtime Assurance for LLM-Assisted ISR Swarms over a Verification-Aware Fabric

基于验证感知架构的大语言模型辅助情报、监视与侦察集群任务级运行时保障

Nikolaos Kekatos, Panagiotis Katsaros, Alexios Lekidis, Theodoros Nestoridis, Tom Nianios

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究大语言模型辅助的ISR集群任务级运行时保障问题,提出三层组合式运行时验证框架,将任务策略分解,通过验证感知架构聚合判定并融合代数,能检测个体合规但集群违规情况,模拟任务验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26228 2026-07-30 cs.CL 新提交 57%

Steering Instruction Hierarchies at Inference Time

推理时的指令层级调控

Siqi Zeng, Sewoong Lee, Han Zhao, Julia Hockenmaier

专题命中 提示注入 :safety(abstract);分类 cs.CL

AI总结 针对前沿大语言模型常违反指令层级的问题,提出无需训练的V-Steer方法,通过编辑缓存值向量调控指令层级,提升角色冲突基准准确率,性能优于仅提示基线,部分场景达到SoTA训练方法水平。

Comments Published as a conference paper at COLM '26; the first two authors contributed equally to the work. 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24006 2026-07-28 cs.CR cs.AI cs.DC 新提交 57%

Agentic Cloud Decoys: A Deception-Driven Framework for Autonomous Intrusion Investigation

智能云诱饵:一种用于自主入侵调查的欺骗驱动框架

Mohan Manivannan, Dalal Alharthi

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究针对云遥测使入侵理解困难的问题,提出云诱饵人工智能代理框架,通过会话聚合运算符、动态提示生成等方法,在十个AWS S3场景测试中效果良好,能压缩调查路径,多数场景可完全重建,且延迟短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23586 2026-07-28 cs.AI cs.CR 新提交 57%

Are You Still the Agent I Authorized? Earned Authority under a Fixed Ceiling for Evolving Agents

你还是我授权的那个智能体吗?在固定上限下演化智能体的获得性权限

Zhaoxi Zhang, Xiaomei Zhang

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究长期存在的人工智能智能体部署后演化引发的授权问题,提出状态边界模型阐述授权连续性,通过固定过渡包络和效果上限,区分请求与实现效果,证明突变不会超上限,还映射了六种突变类别的授权后果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06550 2026-07-28 cs.CR cs.AI 版本更新 57%

SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills

SkillSieve:一种用于检测恶意AI代理技能的分层分流框架

Yinghan Hou, Zongyou Yang

机构 * Department of Earth Science and Engineering(地球科学与工程系) Imperial College London(帝国理工学院伦敦分校) Department of Computer Science(计算机科学系) University College London(伦敦大学学院) Lingban Technology Co., Ltd.(灵伴科技有限公司) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 提出SkillSieve三层检测框架,通过启发式评分、LLM子任务分析和多LLM陪审团辩论,高效检测恶意AI代理技能,在390个技能基准上达到F1=0.920。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19595 2026-07-23 cs.CR cs.CL 新提交 57%

Twin Agent: Context Residual Compression for Privilege Separated Agents

孪生智能体:用于特权分离智能体的上下文残差压缩

Zhanhao Hu, Dennis Jacob, Xiao Huang, Zhaorun Chen, Bo Li, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 针对大语言模型智能体易受安全风险问题,提出孪生智能体模式,由探索和安全智能体组成,通过探索智能体传递紧凑提示,减少信息需求,在保持高任务效用的同时防止提示注入攻击,优于其他基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19432 2026-07-23 cs.CR cs.AI 新提交 57%

ChainWatch: A Kill Chain-Aligned Sequential Detection Framework for Multi-Step Attacks in MCP-Based AI Agent Systems

ChainWatch:基于杀伤链的顺序检测框架,用于基于MCP的人工智能代理系统中的多步攻击

Om Narayan, Rashmi Jyoti, Ramkinker Singh

机构 * Computer Science New York University New York, USA(计算机科学 新 York 大学 新 York 美国) Cybersecurity University of Maryland, College Park MD, USA(网络安全 美国马里兰大学College Park分校 MD 美国) Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学 彭博 美国)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对基于MCP的人工智能代理系统中现有防御无法可靠检测多步攻击的问题,提出ChainWatch框架,用六阶段杀伤链建模攻击进展,结合隐马尔可夫模型分类工具调用序列,能检测逃避传统机制的攻击链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18485 2026-07-22 cs.CR cs.AI 新提交 57%

Trusted Credentials, Untrusted Behavior: Benchmarking LLM-Agent Security in High-Performance Computing

可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试

Jie Li

机构 * Texas Tech University(德克萨斯技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17467 2026-07-22 cs.CR cs.CL 版本更新 57%

PARSE: Provenance-Aware Retrieval Sanitization for Professional Domain LLM Agents

PARSE: 面向专业领域LLM Agent的溯源感知检索净化

Aaditya Pai

机构 * Data Science Institute(数据科学研究所)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 针对真实企业文档中提示注入攻击难以防御的问题,提出PARSE方法,通过分类句子注入可能性、提取结构化事实并验证一致性,将攻击成功率从25.4%降至15.6%,同时保持86.9%的实用性。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17535 2026-07-21 cs.CR cs.CL 新提交 57%

Salience Induction against Multi-Hop RAG Agents: Threat and Defense

针对多跳检索增强生成智能体的显著性诱导:威胁与防御

Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou

机构 * National University of Defense Technology(国防科技大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 研究多跳检索增强生成智能体面临的新攻击面——显著性通道,提出显著性诱导方法并定义操作符类,构建管道,引入基准。通过实验评估多种模型和架构,展示该方法有效性,强调智能体RAG需防御显著性 - 相关性解耦。

Comments 18 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13718 2026-07-21 cs.CR cs.AI 版本更新 57%

How Agents Ask for Permission: User Permissions for AI Agents, from Interfaces to Enforcement

智能体如何请求许可:人工智能智能体的用户权限,从接口到执行

Alexandra E. Michael, Franziska Roesner

机构 * University of Washington(华盛顿大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究人工智能智能体系统中用户级权限处理问题,通过调查21个提案构建分类法,分析五个商业智能体并与文献系统比较,确定主题与空白,为智能体权限系统研究提供参考。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14006 2026-07-16 cs.CR cs.AI 新提交 57%

Rethinking Penetration Testing for AI-Enabled Systems: From Resource Compromise to Behavioral Objective Violation

重新思考人工智能系统的渗透测试:从资源妥协到行为目标违反

Mohammad Allahbakhsh, Mohammad Hassan Bahari, Moslem Attar-Raouf

机构 * Sensifai BV(Sensifai公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文重新思考人工智能系统渗透测试,将其定义为目标驱动的行为评估,涵盖多种对抗途径。提出测试工作流程,通过实例展示渗透可通过行为影响发生,为评估已部署人工智能系统中的对抗成功提供技术框架。

Comments 42 pages, 5 Tables, 21 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01143 2026-07-14 cs.AI 版本更新 57%

A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents

面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式

Sheldon Yu, Yingcheng Sun, Hanqing Guo, Qianqian Tong

机构 * University of California, San Diego(加州大学圣地亚哥分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16966 2026-07-13 cs.CR cs.AI 57%

Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning

视觉 inception:通过多模态记忆污染在代理推荐系统中妥协长期规划

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出视觉 inception 攻击,通过污染用户上传的图片在代理推荐系统中影响长期规划,提出 CognitiveGuard 防御框架以降低攻击风险。

Comments 17 pages, 6 figures, 16 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 20846-20862, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20064 2026-07-13 cs.PL cs.AI cs.CR 版本更新 57%

The LLMbda Calculus: AI Agents, Conversations, and Information Flow

LLMlambda 计算:人工智能代理、对话与信息流

Zac Garby, Andrew D. Gordon, David Sands

机构 * University of Nottingham, UK(诺丁汉大学) University of Edinburgh, UK(爱丁堡大学) Chalmers University of Technology(查尔姆斯理工大学) The University of Gothenburg, Sweden(哥德堡大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05277 2026-07-07 cs.CR cs.LG 新提交 57%

Untrusted Content Masking for Web Agents with Security Guarantees

具备安全保证的Web智能体不可信内容掩码技术

Kristina Nikolić, Egor Zverev, Javier Rando, Matthew Jagielski, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) ISTA(瑞士信息科学与技术学院) Anthropic(Anthropic公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05120 2026-07-07 cs.CR cs.AI 新提交 57%

Agent Data Injection Attacks are Realistic Threats to AI Agents

智能体数据注入攻击对人工智能智能体构成现实威胁

Woohyuk Choi, Juhee Kim, Taehyun Kang, Jihyeon Jeong, Luyi Xing, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学) Largosoft University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 介绍智能体数据注入攻击(ADI)这一新型间接提示注入,其伪装可信数据注入恶意数据使智能体执行意外操作,研究发现现实智能体漏洞及ADI在多种模型和智能体设置中有效,揭示智能体安全关键差距。

Comments 19 pages, 19 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04240 2026-07-07 cs.AI q-bio.CB 新提交 57%

Biological Motifs for Agentic Control

用于智能体控制的生物基序

Bogdan Banu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。

Comments 80 pages. Preprint; feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏