Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models
定位信息是否有助于去学习?对语言模型中知识去学习的局部参数归因的严格检验
AI总结 本文通过实验验证局部参数更新对语言模型知识去学习的有效性,发现参数局部性并不必然指示有效知识去除。
Comments The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)