Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection
反转思路:通过单秩安全注入实现轻量级对齐增强
机构 * King Abdullah University of Science and Technology (KAUST)(卡布尔大学科学与技术学院)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出单秩安全注入(ROSI)这一无需微调的白盒方法,通过修改模型权重增强 LLM 安全对齐,可提升安全拒绝率且保留模型效用,还可重新对齐未审查模型,是高效的 LLM 安全改进机制。
Comments EMNLP 2026, Main Conference