arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-22 至 2025-08-22 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2508.15182 2025-08-22 cs.LG 85%

SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks

Xiangman Li, Xiaodong Wu, Qi Li, Jianbing Ni, Rongxing Lu

机构 * Department of Electrical and Computer Engineering, Queen’s University(电气与计算机工程系,皇后大学) School of Computing, Queen’s University(计算机学院,皇后大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15283 2025-08-22 cs.IR cs.CL 57%

Adversarial Attacks against Neural Ranking Models via In-Context Learning

Amin Bigdeli, Negar Arabzadeh, Ebrahim Bagheri, Charles L. A. Clarke

机构 * University of Waterloo(多伦多大学) University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19521 2025-08-22 cs.CR 50%

Security Steerability is All You Need

Itay Hazan, Idan Habler, Ron Bitton, Itsik Mantin

专题命中 越狱攻击 :prompt injection(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06154 2025-08-22 cs.CV 50%

GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models

M. Jehanzeb Mirza, Mengjie Zhao, Zhuoyuan Mao, Sivan Doveh, Wei Lin, Paul Gavrikov, Michael Dorkenwald, Shiqi Yang, Saurav Jha, Hiromi Wakaki, Yuki Mitsufuji, Horst Possegger, Rogerio Feris, Leonid Karlinsky, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Sony(索尼) Weizmann Institute of Science(魏茨曼科学研究院) JKU(约翰纳斯堡大学) Tübingen AI Center(图宾根人工智能中心) UVA(乌得勒支大学) UNSW(新南威尔士大学) TU Graz(格拉茨技术大学) MIT-IBM(麻省理工学院-IBM)

专题命中 越狱攻击 :safety(abstract)

Comments Code: https://github.com/jmiemirza/GLOV

详情

展开后加载摘要…

URL PDF HTML 收藏