RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models
RAJ-PGA:基于推理激活和原则引导对齐的大型推理模型安全对齐框架
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Zhongguancun Academy(中关村学院) ; College of Cryptology and Cyber Science, Nankai University(南开大学密码与网络安全学院) ; School of Cybersecurity and Technology, Sun Yat-sen University(中山大学网络安全学院)
专题命中 越狱攻击 :alignment(title,abstract);jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 RAJ-PGA框架通过推理激活和原则引导对齐方法,提升大型推理模型的安全性,减少有害推理链的影响,同时保持模型推理能力。
Comments 12 pages, 6 figures