Understanding and Preserving Safety in Fine-Tuned LLMs
理解并保持在微调大语言模型中的安全性
机构 * Zhejiang University(浙江大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Waterloo(滑铁卢大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Sun Yat-sen University(中山大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 本文提出安全保持微调(SPF)方法,通过分析安全性与实用性梯度的几何关系,有效解决微调过程中安全性与实用性之间的矛盾,保持模型性能并恢复预训练的安全性对齐。