arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-25 至 2026-08-25 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 7 篇

2608.21500 2026-08-25 cs.CR cs.AI 新提交 85%

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation

SecOPD:通过策略内蒸馏缓解自适应提示注入攻击

Yibo Peng, Long Lian, David Wagner, Sizhe Chen

专题命中 提示注入 :prompt injection(title,abstract);DPO(abstract,abstract_cn);分类 cs.AI

AI总结 针对AI智能体面临的自适应提示注入攻击,提出SecOPD方法,通过令牌级反馈优化防御微调,大幅降低攻击成功率,且安全性可泛化到工具调用等新领域。

Comments EMNLP 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25194 2026-08-25 cs.LG 版本更新 83%

Localize and Neutralize: Gradient-guided Token Suppression against Visual Prompt Injection Attack

先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击

Dongpeng Zhang, Ke Ma, Yangbangyan Jiang, Gaozheng Pei, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) Alibaba Group(阿里巴巴集团) School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22248 2026-08-25 cs.CR 新提交 82%

Beyond Over-Refusal: Defending Indirect Prompt Injection via Latent Instruction Manifolds

超越过度弃权:通过潜在指令流形防御间接提示注入攻击

Jiahao Chen, Rui Yin, Xinfeng Li, Qianli Ma, Tianyu Du, Zhihui Fu, Jun Wang, Zhaoxiang Wang, Shouling Ji

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract)

AI总结 针对LLMs防御间接提示注入时的安全-效用权衡问题,提出AEGIS模型,通过指令敏感投影器与统一多层共识机制实现出色的攻击检测性能,缓解IPI攻击。

Comments Extended Content of EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04565 2026-08-25 cs.CR cs.AI cs.CL 版本更新 73%

Breadcrumbing Search Agents

面包屑式搜索智能体

Xuebin Li, Hanqing Zhao, Siyuan Liang, Kejiang Chen, Weiming Zhang, Dacheng Tao, Nenghai Yu

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM搜索智能体的安全问题,提出ACH和TGSE策略,通过操纵搜索结果形成连贯证据链,大幅提升攻击成功率。

Comments 39 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21656 2026-08-25 cs.CL 新提交 70%

Mitigating Database Leakage in RAG Systems with Keyword-Grounded Fact Substitution

基于关键词锚定的事实替换缓解RAG系统中的数据库泄露

Ziliang Zhang, Yubo Zhu, Wei Tong, Jingyu Hua, Zijian Wang, Yuan Zhang, Sheng Zhong

机构 * Nanjing University(南京大学)

专题命中 提示注入 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL

AI总结 针对RAG系统易受提示注入攻击导致数据库泄露的问题,提出KFS-RAG防御方法,通过关键词锚定的事实替换缓解泄露风险,同时保持响应准确性与相关性,为构建安全可信RAG系统提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09737 2026-08-25 cs.LG 版本更新 70%

System-Prompt Anchoring with Cross-Attention Layers

CALYREX:跨注意力层扩展变换器用于系统提示锚定

Li Lixing

机构 * Cornell University(康奈尔大学)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.LG

AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。

Comments Preprint. 14 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-25 cs.CR cs.AI 版本更新 57%

Your Agentic LLMs Secretly Encode Indirect Prompt-Injection Exposure in Hidden States

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Peng Xu, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments v2. Compared to v1, we include the Kimi-K3 model's results and conduct a series of new experiments on understanding probe generalization

详情

展开后加载摘要…

URL PDF HTML 收藏