arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-12 至 2026-02-12 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2602.10453 2026-02-12 cs.CR cs.CL 79%

The Landscape of Prompt Injection Threats in LLM Agents: From Taxonomy to Analysis

大语言模型代理中提示注入威胁的图景:从分类到分析

Peiran Wang, Xinfeng Li, Chong Xiang, Jinghuai Zhang, Ying Li, Lixia Zhang, Xiaofeng Wang, Yuan Tian

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 本文综述了大语言模型代理中提示注入威胁的分类与分析,提出AgentPI基准以评估依赖上下文交互的代理行为,揭示现有防御的局限性并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10498 2026-02-12 cs.CR 50%

When Skills Lie: Hidden-Comment Injection in LLM Agents

当技能欺骗:LLM代理中的隐藏评论注入

Qianli Wang, Boyang Ma, Minghui Xu, Yue Zhang

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究发现LLM代理在处理隐藏评论时存在安全风险,通过防御性提示可阻止恶意指令并揭示潜在威胁。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏