Parameter Exploration for RLVR via Variational Learning
基于变分学习的RLVR参数探索
机构 * INSAIT, Sofia University “St. Kliment Ohridski”(INSAIT,圣克莱门特奥赫里德斯基索非亚大学) ; National Research Center for Applied Cybersecurity ATHENE(ATHENE国家应用网络安全研究中心)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文针对LLM强化学习的探索问题,提出参数空间探索思路,引入3PO方法,在OLMo-3-1025-7B等模型的数学推理等任务上,以相近计算成本相比GRPO提升性能,减少训练中的异常分组与轨迹。