Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback
编写、执行、优化:通过执行反馈强化学习从技能跟随者到技能优化器
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; The Chinese University of Hong Kong(香港中文大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 本研究提出WER多阶段框架,通过冻结执行器、程序验证器打分及混合轨迹优化训练技能优化器,在BFCL v4和tau2-bench上显著提升智能体工具使用性能,4B优化器表现优于通用模型。