DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
DRA-GRPO:你的GRPO需要了解多样化的推理路径以进行数学推理
机构 * Morgan Stanley(摩根士丹利) ; Clemson University(克莱姆森大学) ; Arizona State University(亚利桑那州立大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; University of Notre Dame(圣母大学) ; University of Arizona(亚利桑那大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 针对GRPO在数学推理中因奖励信号非单射导致策略坍塌的问题,提出基于子模互信息的多样性感知奖励调整框架DRA,通过逆倾向评分去偏梯度估计,在五个数学基准上以少量数据和成本取得平均58.2%的准确率。
Comments ACL2026