arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-31 至 2026-08-31 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 4 篇

2608.23873 2026-08-31 cs.AI cs.CL cs.CR cs.LG 版本更新 82%

Semantic Overlays: Mitigating Prompt Injection with Annotations Beyond Tokens and Steering Vectors

语义覆盖层:通过超越 token 和引导向量的注释缓解提示注入攻击

Joshua Penman

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出 Semantic Overlays 技术,通过在冻结语言模型残差流上应用小型学习适配器构建带外注释通道,有效缓解提示注入攻击,在多个基准测试中大幅降低攻击成功率且保持模型效用。

Comments 21 pages, 4 figures, 13 tables. Interactive demo: this https URL (https://semantic-overlays.vercel.app). Code and released adapters: this https URL (https://github.com/JoshuaSP/semantic-overlays)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28411 2026-08-31 cs.CR cs.AI 新提交 79%

LongPIBench: A Long-Context Benchmark for Prompt Injection

LongPIBench:用于提示注入的长上下文基准

Yupei Liu, Yuqi Jia, Neil Zhenqiang Gong, Jinyuan Jia

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究人员推出涵盖4类场景的长上下文基准LongPIBench,发现现有提示注入防御在长上下文下漏洞显著,简单攻击即可绕过,该基准可用于系统评估此类防御。

Comments To appear in Findings of EMNLP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27496 2026-08-31 cs.CR 新提交 78%

ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection

ROPE:针对间接提示注入的路由来源策略执行

Xinhang Ma, Chaowei Xiao, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出ROPE防御间接提示注入,通过确定性来源检查实现可证明的安全保证,在低攻击成功率的同时保留高智能体效用,优于现有系统级防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27990 2026-08-31 cs.CR cs.AI 新提交 57%

CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?

CAITLYN:大语言模型智能体能否自主合成针对新型注入攻击的防御措施?

Zi Liang, Xiaoyu Xu, Yanyun Wang, Minxin Du, Qingqing Ye, Haibo Hu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对LLM智能体注入攻击防御的三难困境,提出智能体无关防御中间件CAITLYN,其含即时防御与自主合成新防御的双系统,在标准基准与新基准Emerging上均表现优异,可降低攻击成功率。

Comments Source code: this https URL (https://github.com/liangzid/caitlyn)

详情

展开后加载摘要…

URL PDF HTML 收藏