arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-10 至 2026-02-10 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 4 篇

2602.07918 2026-02-10 cs.CR cs.LG stat.ME 79%

CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution

CausalArmor: 通过因果归因实现高效的间接提示注入防护

Minbeom Kim, Mihir Parmar, Phillip Wallis, Lesly Miculicich, Kyomin Jung, Krishnamurthy Dj Dvijotham, Long T. Le, Tomas Pfister

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google(谷歌) Google Deepmind(谷歌DeepMind) Seoul National University(首尔国立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 CausalArmor通过因果归因实现高效间接提示注入防护,提升AI代理的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00181 2026-02-10 cs.CR cs.AI cs.LG 66%

CHAI: Command Hijacking against embodied AI

CHAI:针对具身AI的命令劫持

Luis Burbano, Diego Ortiz, Qi Sun, Siwei Yang, Haoqin Tu, Cihang Xie, Yinzhi Cao, Alvaro A Cardenas

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

AI总结 CHAI是一种针对具身AI的物理环境间接提示注入攻击,通过嵌入误导性自然语言指令,利用多模态语言解释能力,有效提升了攻击性能,凸显了对传统对抗鲁棒性之外的防御需求。

Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06914 2026-02-10 cs.CR cs.AI 57%

SoK: Trust-Authorization Mismatch in LLM Agent Interactions

SoK:LLM代理交互中的信任-授权不匹配

Guanquan Shi, Haohua Du, Zhiqiang Wang, Xiaoyu Liang, Weiwenpei Liu, Song Bian, Zhenyu Guan

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过B-I-P框架系统分析LLM代理交互中的信任-授权不匹配问题,揭示了动态信任与静态授权之间的脱节,并提出动态风险适应性授权的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07398 2026-02-10 cs.CR cs.AI 57%

AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management

AgentSys: 通过显式分层内存管理实现安全且动态的LLM代理

Ruoyao Wen, Hao Li, Chaowei Xiao, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 AgentSys通过显式分层内存管理有效防御间接提示注入攻击,显著降低攻击成功率并提升LLM代理的安全性和动态性。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏