Rethinking Groups in Critic-Free RLVR
重新思考无评论强化学习中的分组
机构 * Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所) ; University of Waterloo(滑铁卢大学) ; The Chinese University of Hong Kong(香港中文大学) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 针对无评论强化学习分组策略的数据低效和同步问题,提出负令牌过滤方法,实现单次 rollout 稳定训练,在推理和代理任务上表现相当或更优。