Boosting LLM Exploration via Weak-Model Guidance in RLVR
通过RLVR中的弱模型引导增强大语言模型探索能力
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) ; National Engineering Research Center of New Electronic Publishing Technologies(国家新型电子出版技术工程研究中心)
专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);language model(abstract);prompting(abstract)
AI总结 本研究提出弱模型引导的RLVR方法,通过弱模型的部分推理轨迹增强LLM探索,缓解熵崩溃,在数学基准上提升大k值下的推理性能与覆盖范围。
Comments 13 pages, 4 figures