CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
CATNIP:通过校准和令牌化的负偏好对齐实现LLM去学习
机构 * George Mason University(乔治·马歇尔大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL
AI总结 CATNIP通过校准和令牌化的负偏好对齐方法,实现有效LLM去学习,无需保留数据或对比对,提升知识遗忘与保留的平衡。