arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-04 至 2025-11-04 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2511.00509 2025-11-04 cs.AI cs.CR 90%

Reimagining Safety Alignment with An Image

Yifan Xia, Guorui Chen, Wenqian Yu, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University, Wuhan, China(武汉大学信息管理学院) Torr Vision Group, University of Oxford, Oxford, United Kingdom(牛津大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03343 2025-11-04 cs.CR cs.AI cs.CL 84%

What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks

Nathalie Kirch, Constantin Weisser, Severin Field, Helen Yannakoudakis, Stephen Casper

机构 * King’s College London(伦敦国王学院) Imperial College London(伦敦帝国学院) Deepgram University of Louisville(路易斯维尔大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00556 2025-11-04 cs.CL 79%

Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack

Peng Ding, Jun Kuang, Wen Sun, Zongyu Wang, Xuezhi Cao, Xunliang Cai, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Meituan Inc.(美团公司)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL

Comments Preprint, 14 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏