arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-27 至 2026-02-27 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 4 篇

2602.22450 2026-02-27 cs.CR cs.AI 83%

Silent Egress: When Implicit Prompt Injection Makes LLM Agents Leak Without a Trace

静默逃逸:当隐式提示注入使LLM代理无痕泄露

Qianlong Lan, Anuj Kaul, Shaun Jones, Stephanie Westrum

机构 * eBay

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究揭示了代理式LLM系统中隐式提示注入导致的静默逃逸风险,通过实验展示恶意网页诱导代理泄露敏感信息的机制,并提出分片逃逸策略及网络层防御改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22724 2026-02-27 cs.CR cs.AI 79%

AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification

AgentSentry: 通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入

Tian Zhang, Yiwei Xu, Juan Wang, Keyan Guo, Xiaoyang Xu, Bowen Xiao, Quanlong Guan, Jinlin Fan, Jiawei Liu, Zhiquan Liu, Hongxin Hu

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航空信息安全与可信计算重点实验室、教育部、网络安全科学与工程学院、武汉大学) Department of Computer Science and Engineering, University at Buffalo, SUNY(计算机科学与工程系、布法罗大学、纽约州立大学) Department of Computer Science, College of Information Science and Technology, Jinan University(计算机科学系、信息科学与技术学院、济南大学) College of Cyber Security, Jinan University(网络安全学院、济南大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 AgentSentry通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入,有效消除攻击并保持实用性。

Comments 23 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25369 2026-02-27 cs.CL cs.AI cs.LG 75%

Generative Value Conflicts Reveal LLM Priorities

生成价值冲突揭示大语言模型优先级

Andy Liu, Kshitish Ghate, Mona Diab, Daniel Fried, Atoosa Kasirzadeh, Max Kleiman-Weiner

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

专题命中 提示注入 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 生成价值冲突揭示大语言模型优先级,通过ConflictScope评估模型在价值冲突中的优先级,发现模型在开放式设置中更支持个人价值,系统提示能提高对齐效果14%。

Comments Accepted to ICLR 2026 (the 14th International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22481 2026-02-27 cs.CL cs.AI 62%

Sydney Telling Fables on AI and Humans: A Corpus Tracing Memetic Transfer of Persona between LLMs

悉尼在AI与人类之间讲述寓言:LLM间人设的语料追溯膜传

Jiří Milička, Hana Bednářová

专题命中 提示注入 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析LLM生成的文本,探讨悉尼人设在AI与人类关系中的传播与影响,并构建了相关语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏