Understanding Diversity Collapse in RLVR via the Lens of Overtraining
通过过度训练的视角理解RLVR中的多样性崩溃
机构 * Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心) ; Southeast University(东南大学) ; Microsoft(微软) ; Data61, CSIRO(澳大利亚联邦科学与工业研究组织Data61) ; Chongqing University(重庆大学) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过过度训练的视角形式化RLVR中的多样性崩溃,发现标准训练中大部分更新是过度训练,并提出贝叶斯边界门控(BBG)方法,通过估计每个问题对推理边界的边际贡献来优化,提升多个基准上的Pass@k。