arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 6 篇

2608.30441 2026-09-01 cs.CR 新提交 82%

ECLIPSE: Self-Evolving Stealthy Prompt Injection Attack against Long-Horizon Agentic Systems

ECLIPSE:针对长视程智能体系统的自演化隐蔽提示注入攻击

Shiqian Zhao, Yangfan Zhou, Xinfeng Li, Runyi Hu, Yechao Zhang, Yi Xie, Tianwei Zhang, Luu Anh Tuan

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract)

AI总结 本研究提出ECLIPSE框架,结合隐蔽攻击轨迹合成与工具链引导,在LASE-Bench上实现高攻击成功率,现有安全措施难以可靠防御,凸显需开发更有效防御手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30362 2026-09-01 cs.AI cs.CL 新提交 81%

Will the User Ever Know? Covert Indirect Prompt Injection on Tool-Using LLM Agents

用户会知道吗?针对使用工具的大语言模型智能体的隐蔽间接提示注入攻击

Yunseok Lee, Yunji Kim, Woojin Lee

机构 * Dongguk University-Seoul(东国大学首尔校区)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对工具型LLM智能体的间接提示注入攻击,将攻击成功率分解为隐蔽与公开成功率,提出ICoA诱导隐蔽攻击,在AgentDojo的四个模型上提升了隐蔽成功率3.79-12.01个百分点。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30041 2026-09-01 cs.CR cs.AI 新提交 74%

Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection

间接提示注入下基于可达性的大语言模型智能体能力约束

Wujie Xiong, Rabimba Karanjai, Yang Lu, Weidong Shi, Lei Xu

专题命中 提示注入 :prompt injection(title);分类 cs.AI

AI总结 针对间接提示注入下大语言模型智能体的权限漏洞,提出SkillGuard防御机制,通过能力限制策略有效降低攻击成功率,且无额外模型调用或令牌开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03204 2026-09-01 cs.CL 版本更新 57%

FocusAgent: Simple Yet Effective Ways of Trimming the Large Context of Web Agents

FocusAgent:修剪网页智能体大上下文的简单有效方法

Imene Kerboua, Sahar Omidi Shayegan, Megh Thakkar, Xing Han Lù, Léo Boisvert, Massimo Caccia, Jérémy Espinas, Alexandre Aussem, Véronique Eglin, Alexandre Lacoste

机构 * LIRIS - CNRS, INSA Lyon, Universite Claude Bernard Lyon 1(LIRIS - CNRS,INSA里昂,克劳德·贝尔纳大学里昂) Esker ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 该研究提出FocusAgent,通过轻量级LLM检索器修剪网页智能体的无关上下文,在保持性能的同时减少观测规模超50%,并降低提示注入攻击风险。

Comments TMLR 08/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30387 2026-09-01 cs.CR 新提交 50%

Attesting Outputs and Delegation Ancestry in Multi-Agent AI Systems

多智能体AI系统中的输出证明与委托谱系

Lifei Liu, Haoran Yu

专题命中 提示注入 :prompt injection(abstract)

AI总结 该研究针对多智能体AI系统的输出与委托谱系验证问题,提出两层证明设计,对比三种方案,经测试其验证效率满足多服务部署需求,可解决跨部署者的授权与溯源难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30083 2026-09-01 cs.CR cs.MA 新提交 50%

Zero-Knowledge Predicate Proofs Between AI Agents: A Measured, Cross-Protocol Gateway and the Source-Integrity Gap

AI智能体间的零知识谓词证明:一种可测量的跨协议网关与源完整性缺口

Ashok Subbabhatta Gopalakrishna

专题命中 提示注入 :prompt injection(abstract)

AI总结 该研究提出一种跨协议零知识证明网关,实现AI智能体间的可证数据最小化,解决源完整性缺口问题,经实验验证性能达标且符合GDPR数据最小化原则。

Comments 11 pages, 6 figures, 4 tables. Reference implementation available at this https URL (https://github.com/45h0kg/zk-proof-gateway)

详情

展开后加载摘要…

URL PDF HTML 收藏