arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-02 至 2025-12-02 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2512.01326 2025-12-02 cs.CR cs.CL cs.LG 81%

Securing Large Language Models (LLMs) from Prompt Injection Attacks

保护大型语言模型(LLMs)免受提示注入攻击

Omar Farooq Khan Suri, John McCrae

机构 * University of Galway, Ireland(Galway大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究评估了JATMO方法对提示注入攻击的鲁棒性,发现其在减少攻击成功率的同时仍存在漏洞,提示需要更复杂的防御策略。

Comments 10 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00966 2025-12-02 cs.CR cs.LG 79%

Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis

通过指令遵循意图分析缓解间接提示注入

Mintong Kang, Chong Xiang, Sanjay Kariyappa, Chaowei Xiao, Bo Li, Edward Suh

机构 * NVIDIA University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 IntentGuard通过分析指令遵循意图,有效缓解间接提示注入攻击,保持模型性能并降低攻击成功率

详情

展开后加载摘要…

URL PDF HTML 收藏