Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
遗忘的安全性:通过持续学习保持大型语言模型的安全对齐
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过持续学习方法有效缓解大型语言模型在适应新任务时的安全退化问题,证明了持续学习在保持模型安全性和任务实用性方面的有效性。