On the Plasticity and Stability for Post-Training Large Language Models
关于后训练大语言模型的可塑性与稳定性
机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) ; University of the Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究所) ; Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR, China(香港科技大学(香港特别行政区)计算机科学与工程系)
专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(title);分类 cs.LG
AI总结 本文提出PCR框架,通过概率方法解决GRPO中可塑性与稳定性之间的几何冲突,提升训练稳定性与推理性能。