Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models
训练后探索恢复:大型推理模型的潜在探索解码
机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) ; MiLM Plus, Xiaomi Inc., Beijing, China(小米公司北京MiLM Plus团队) ; University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米莉亚大学) ; University of Pisa, Italy(比萨大学)
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出Latent Exploration Decoding方法,通过累积中间后验并选择熵最大配置来提升推理模型的pass@1和pass@16准确率,同时增强强化学习中的探索能力。
Comments Project Page: https://github.com/AlbertTan404/LED