A Comedy of Estimators: On KL Regularization in RL Training of LLMs
估计器的喜剧:关于在LLM训练中的KL正则化
机构 * McGill University(麦吉尔大学) ; LawZero(法零) ; LLNL(劳伦斯利弗莫尔国家实验室) ; University of Edinburgh(爱丁堡大学) ; CIFAR AI Chair(CIFAR人工智能主席) ; CIFAR Fellow
AI总结 本文研究了在LLM训练中使用KL正则化的估计器方法,分析了不同配置对训练稳定性及下游性能的影响,发现偏导数估计器可能导致训练不稳定,而无偏导数估计器能提升模型在领域内外任务的表现。