Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
通过难度目标在线数据选择和回放提升大语言模型强化微调的数据效率
机构 * UIUC(伊利诺伊大学香槟分校) ; New York University(纽约大学) ; University of Texas at Austin(得克萨斯大学奥斯汀分校) ; Microsoft(微软)
AI总结 本文提出通过难度目标在线数据选择和回放机制提升大语言模型强化微调的数据效率,实验表明可减少62%的微调时间并保持同等性能。
Comments Accepted at NeurIPS 2025