Clipping-Free Policy Optimization for Large Language Models
无需裁剪的策略优化用于大语言模型
机构 * KUIS AI Center, Koç University, Istanbul, Türkiye(Koç大学) ; Koç University, Istanbul, Türkiye(Koç大学) ; University of California, Berkeley, CA, USA(加州大学伯克利分校)
AI总结 CFPO通过凸二次惩罚替代裁剪机制,实现稳定策略优化,适用于大语言模型的训练。
Comments 23 pages, 10 tables, 8 figures