SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
SafeSteer: 局部化在策略蒸馏用于高效安全对齐
机构 * Beihang University(北航) ; Beijing Institute of Technology(北京理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。
Comments 19 pages, 8 figures, 14 tables. Submitted to EMNLP 2026