Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR
协调标记与序列:动态混合策略优化用于RLVR
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。