arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-17 至 2025-10-17 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2506.10597 2025-10-17 cs.CR cs.AI 83%

SoK: Evaluating Jailbreak Guardrails for Large Language Models

Xunguang Wang, Zhenlan Ji, Wenxuan Wang, Zongjie Li, Daoyuan Wu, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Renmin University of China(中国人民大学) Lingnan University(岭南大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

Comments Accepted by IEEE S&P 2026 Cycle 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13541 2025-10-17 eess.AS cs.LG 83%

SPIRIT: Patching Speech Language Models against Jailbreak Attacks

Amirbek Djanibekov, Nurdaulet Mukhituly, Kentaro Inui, Hanan Aldarmaki, Nils Lukas

机构 * MBZUAI Tohoku University(东北大学) RIKEN(日本科学技术研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14845 2025-10-17 cs.LG cs.CV 57%

Backdoor Unlearning by Linear Task Decomposition

Amel Abdelraheem, Alessandro Favero, Gerome Bovet, Pascal Frossard

机构 * EPFL(苏黎世联邦理工学院) Cyber-Defence Campus, armasuisse(网络安全校园,armasuisse)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏