GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
GDSD:强化学习作为扩散语言模型的引导去噪器自蒸馏
机构 * UCL Dept. of Statistical Science(伦敦大学学院统计科学系) ; UCL Centre for AI(伦敦大学学院人工智能中心) ; Alibaba Group(阿里巴巴集团) ; Dept. of EEE(电子工程系) ; Imperial College London(伦敦帝国理工学院) ; UNIST(全南大学) ; University of Basel(巴塞尔大学)
专题命中 数学推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出引导去噪器自蒸馏(GDSD)方法,通过从逆KL正则化强化学习的闭式最优解中导出的优势引导自教师直接蒸馏扩散语言模型的去噪器,避免了ELBO似然代理带来的训练-推理不匹配偏差,在规划、数学和代码基准上显著优于现有方法。
Comments Preprint