Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL
Envs-FORGE:面向智能体强化学习的前沿优化、奖励驱动的环境合成方法
机构 * IDEA Research(IDEA研究院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; DataArcTech Ltd.(DataArcTech有限公司)
专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.CL
AI总结 Envs-FORGE是面向智能体RL的奖励驱动环境合成方法,通过MILP选动作生成训练环境,在多模型及数据集上显著提升Pass@1等指标。
Comments 19 pages, 5 figures