Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards
通过受限数据合成和渐进奖励训练LLM进行多步骤工具协调
机构 * Amazon Services Inc.(亚马逊服务公司) ; Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) ; School of Computational Science and Engineering, Georgia Institute of Technology(佐治亚理工学院计算科学与工程学院)
专题命中 工作流自动化 :agentic(abstract);分类 cs.CL、cs.LG
AI总结 本文提出强化学习框架解决LLM多步骤工具协调难题,通过构建确定性环境和渐进奖励机制提升执行准确率,并在不同API生态中实现技能迁移。
Comments Under Review