Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
通过群体回合策略优化增强多轮工具集成代理推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; AWS AI Labs(AWS人工智能实验室) ; NVIDIA ; Meta
AI总结 本文提出GTPO算法,通过细粒度奖励、优势估计和自监督奖励塑造,提升大语言模型在多轮工具推理任务中的性能,优于GRPO并在常识推理和程序合成任务中表现更佳。