arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-20 至 2026-02-20 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2602.16752 2026-02-20 cs.CR 82%

The Vulnerability of LLM Rankers to Prompt Injection Attacks

大语言模型排序器对提示注入攻击的脆弱性

Yu Yin, Shuai Wang, Bevan Koopman, Guido Zuccon

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract)

AI总结 本文研究了大语言模型排序器对提示注入攻击的脆弱性,通过实验证明不同架构和设置下的攻击效果,并揭示了编码器-解码器架构的抗性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01295 2026-02-20 cs.CR 75%

Systems Security Foundations for Agentic Computing

面向代理计算的安全基础

Mihai Christodorescu, Earlence Fernandes, Ashish Hooda, Somesh Jha, Johann Rehberger, Kamalika Chaudhuri, Xiaohan Fu, Khawaja Shams, Guy Amir, Jihye Choi, Sarthak Choudhary, Nils Palumbo, Andrey Labunets, Nishit V. Pandya

专题命中 提示注入 :safety(abstract);prompt injection(abstract);AI safety(abstract)

AI总结 本文从系统安全角度出发,分析代理型AI的安全挑战,提出端到端安全属性研究,涵盖11个现实攻击案例并定义新的研究问题。

详情

展开后加载摘要…

URL PDF HTML 收藏