The Easy, the Hard, and the Learnable: Confidence and Difficulty-Adaptive Policy Optimization for LLM Reasoning
简单、困难与可学习:面向LLM推理的置信度与难度自适应策略优化
机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) ; Stanford University(斯坦福大学) ; Sydney AI Centre, The University of Sydney(悉尼大学人工智能中心)
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.LG
AI总结 针对GRPO训练中均匀采样导致计算效率低的问题,提出CoDaPO方法,通过置信度和难度自适应重加权与重采样,在固定预算下提升可学习问题的发现,在12个基准上优于现有RL方法。
Comments Published in ICML 2026