arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-29 至 2025-10-29 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2505.16947 2025-10-29 cs.LG cs.AI 73%

MixAT: Combining Continuous and Discrete Adversarial Training for LLMs

Csaba Dékány, Stefan Balauca, Robin Staab, Dimitar I. Dimitrov, Martin Vechev

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱孟·奥赫里迪斯基") ETH Zurich(苏黎世联邦理工学院) ELTE Eötvös Loránd University, Budapest, Hungary(ELTE 爱斯特霍特·洛兰德大学,布达佩斯,匈牙利)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments Published at 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24034 2025-10-29 cs.CV 50%

AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts

Yufan Liu, Wanqian Zhang, Huashan Chen, Lin Wang, Xiaojun Jia, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Cyberspace, Hangzhou Dianzi University(杭州电子科技大学网络空间学院) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :safety(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏