CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
CLIPO: 在策略优化中通过对比学习推广RLVR
机构 * Qwen Large Model Application Team, Alibaba Institute of Automation, Chinese Academy of Sciences(文勤大模型应用团队,阿里巴巴自动化研究所,中国科学院) ; Qwen Large Model Application Team, Alibaba(文勤大模型应用团队,阿里巴巴)
AI总结 CLIPO通过对比学习机制改进RLVR,提升大语言模型的策略优化泛化与鲁棒性