Fail-Closed Alignment for Large Language Models
大型语言模型的Fail-Closed对齐
机构 * Oregon State University, Corvallis, OR USA(俄勒冈州立大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 本文提出fail-closed对齐原则,通过冗余独立路径提升LLM安全,有效对抗基于提示的Jailbreak攻击。
Comments Pre-print