ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning
ERR+: 用于高效且果断的LLM推理的顺序熵分辨率
机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ; ByteDance(字节跳动)
专题命中 代码与定理证明 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG
AI总结 该研究针对RLVR方法对推理过程质量指导不足的问题,提出两阶段RLVR框架ERR+,通过顺序优化熵缓解奖励与稳健相对效率奖励,在五个数据集上实现了LLM推理准确率与简洁性的提升。
Comments 16 pages, 5 figures