arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-24 至 2025-10-24 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2510.11570 2025-10-24 cs.CR cs.CL 85%

Bag of Tricks for Subverting Reasoning-based Safety Guardrails

Shuo Chen, Zhen Han, Haokun Chen, Bailan He, Shengyun Si, Jingpei Wu, Philip Torr, Volker Tresp, Jindong Gu

机构 * LMU Munich(慕尼黑大学) Siemens(西门子) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Berlin(柏林技术大学) Konrad Zuse School of Excellence in Reliable AI (relAI)(Konrad Zuse可靠性人工智能卓越学院) DFKI AWS AI(AWS人工智能) University of Oxford(牛津大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

Comments OpenAI Red-teaming Challenge Winner and Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11851 2025-10-24 cs.CR cs.CL 77%

Deep Research Brings Deeper Harm

Shuo Chen, Zonggen Li, Zhen Han, Bailan He, Tong Liu, Haokun Chen, Georg Groh, Philip Torr, Volker Tresp, Jindong Gu

机构 * LMU Munich(慕尼黑大学) Siemens(西门子) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Munich (TUM)(慕尼黑技术大学) AWS AI(亚马逊AI) Konrad Zuse School of Excellence in Reliable AI (relAI)(Konrad Zuse卓越可靠AI学校) University of Hong Kong (HKU)(香港大学) University of Oxford(牛津大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Accepted to Reliable ML from Unreliable Data Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20223 2025-10-24 cs.CR cs.MM 75%

Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations

Divyanshu Kumar, Shreyas Jena, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi

专题命中 越狱攻击 :alignment(abstract);safety(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21401 2025-10-24 cs.CV 75%

JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation

Md Jueal Mia, M. Hadi Amini

机构 * Knight Foundation School of Computing and Information Sciences (KFSCIS)(骑士基金会计算与信息科学学院) Florida International University(佛罗里达国际大学) Sustainability, Optimization, and Learning for InterDependent networks laboratory (solid lab)(可持续性、优化与互依赖网络学习实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14536 2025-10-24 cs.CL 70%

Breaking Bad Tokens: Detoxification of LLMs Using Sparse Autoencoders

Agam Goyal, Vedant Rathi, William Yeh, Yian Wang, Yuen Chen, Hari Sundaram

机构 * Siebel School of Computing and Data Science(计算机与数据科学学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏