2512.21852
2026-03-19
cs.LG
cs.AI
A Comedy of Estimators: On KL Regularization in RL Training of LLMs
估计器的喜剧:关于在LLM训练中的KL正则化
Vedant Shah, Johan Obando-Ceron, Vineet Jain, Brian Bartoldson, Bhavya Kailkhura, Sarthak Mittal, Glen Berseth, Pablo Samuel Castro, Yoshua Bengio, Nikolay Malkin, Moksh Jain, Siddarth Venkatraman, Aaron Courville
机构
*
McGill University(麦吉尔大学)
;
LawZero(法零)
;
LLNL(劳伦斯利弗莫尔国家实验室)
;
University of Edinburgh(爱丁堡大学)
;
CIFAR AI Chair(CIFAR人工智能主席)
;
CIFAR Fellow
AI总结
本文研究了在LLM训练中使用KL正则化的估计器方法,分析了不同配置对训练稳定性及下游性能的影响,发现偏导数估计器可能导致训练不稳定,而无偏导数估计器能提升模型在领域内外任务的表现。