DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay
DyJR: 通过动态Jensen-Shannon回放在强化学习中保持多样性
机构 * Griffith University, Australia(澳大利亚格里菲斯大学) ; Fudan University, China(复旦大学) ; Beijing University of Post(北京邮电大学) ; Shanghai Innovation Institute, China(上海创新研究院) ; Shanghai Academy of Artificial Intelligence for Science, China(上海人工智能科学研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出DyJR方法,通过动态参考分布和Jensen-Shannon散度正则化,在强化学习中保持多样性,提升数学推理和Text-to-SQL任务性能。
Comments 14 pages, 3 figures