Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs
后门遗忘泛化:走向移除大语言模型中未知触发器的路径
机构 * Inria Paris(法国巴黎国家信息与自动化研究所) ; Sorbonne Université(索邦大学) ; Thales CDI(泰雷兹CDI)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文通过实验证明,针对单个后门的遗忘训练可以泛化抑制其他未明确针对的后门,并引入交叉激活偏移距离量化不同训练引起的模型变化,为利用可控后门移除未知后门提供新方向。
Comments 22 pages, 28 figures