Does Fine-Tuning Undo Activation Steering? Behavioural Recovery Without Weight-Edit Reversal
微调会撤销激活引导吗?无需权重编辑反转的行为恢复
机构 * Brunel University of London(布鲁内尔伦敦大学)
AI总结 本文研究语言模型嵌入的激活引导在SFT、RLHF微调后的稳定性,发现其机制耐久但功能脆弱,需下游训练后重新验证行为。
Comments Accepted at EMNLP 2026 Main. Earlier version at ICLR 2026 Re^4-Align Workshop