How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1
如何训练你的深度研究代理?搜索-R1中的提示、奖励和策略优化
机构 * CASIA(中国科学院自动化研究所) ; NLPR & MAIS(自然语言处理与人工智能研究室) ; School of AI UCAS(中国科学院大学人工智能学院) ; Meituan Inc(美团公司)
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 本文提出通过优化提示模板、奖励函数和策略优化方法来提升深度研究代理的性能,通过实验发现快速思考模板和REINFORCE在性能和稳定性上表现更优,同时引入Search-R1++基线提升了Search-R1的性能。