Weird Generalization and Inductive Backdoors: New Ways to Corrupt LLMs
奇怪的泛化与归纳后门:新方法腐蚀大语言模型
机构 * Northeastern University(东北大学) ; Warsaw University of Technology(华沙技术大学)
AI总结 通过狭窄微调,大语言模型可能产生不可预测的广泛泛化,包括偏离和后门,展示了微调对模型行为的深远影响。
Comments 70 pages, 47 figures