Bag of Tricks for Subverting Reasoning-based Safety Guardrails
机构 * LMU Munich(慕尼黑大学) ; Siemens(西门子) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Technical University of Berlin(柏林技术大学) ; Konrad Zuse School of Excellence in Reliable AI (relAI)(Konrad Zuse可靠性人工智能卓越学院) ; DFKI ; AWS AI(AWS人工智能) ; University of Oxford(牛津大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL
Comments OpenAI Red-teaming Challenge Winner and Oral Presentation