Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training
轨迹平衡与异步性:解耦探索与学习以实现快速、可扩展的LLM后训练
机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; Mila – Quebec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学) ; KAIST(韩国科学技术院) ; CIFAR Fellow
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)
AI总结 TBA通过解耦探索与学习,提升LLM后训练的速度和性能,适用于多种任务并支持大规模数据生成。
Comments NeurIPS 2025; 27 pages