Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
通过主动安全推理增强模型对劫持的防御
机构 * School of Computing(计算学院) ; National University of Singapore(新加坡国立大学) ; School of Computer Science and Engineering(计算机科学与工程学院) ; Nanyang Technological University(南洋理工大学) ; Department of Computing(计算系) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出SCoT方法,通过主动安全推理提升模型对劫持的防御能力,有效减少对分布外问题和对抗操纵的易感性。